arXiv cs.LGは7月9日(現地時間)、アタナシオス・ゼリス氏 (Athanasios Zeris) による研究論文「FourierQK: Filter Shape, Admissibility and the Leakage-Coverage Law」を発表した。同論文は、Frequency-collapse attentionが標準的なドット積アテンションを上回る性能を発揮するメカニズムを追求。Q/Kドット積を学習された周波数におけるバンドパスフィルタリングされた内積に置き換える手法に焦点を当て、そのフィルター特性に関する5つの仮説を検証し、主要な知見を報告している。

ゼリス氏の研究は、DC抑制、ナイキスト抑制、帯域幅、中心周波数、マルチスケールカバレッジといったフィルター特性について、文字レベル言語モデリングにおけるアブレーション実験を通じて詳細に評価した。その主な発見は以下の通りである。

第一に、DC成分とナイキスト成分がモデル性能を積極的に損なうことが明らかになり、発振性を持つバンドパス構造の不可欠性が確認された。第二に、最適なシングルスケール帯域幅は、約70トークンに相当する段落スケールを中心とする約2ビンであることが示され、既存手法であるBASE-DOTと比較して1.15ナッツの性能向上を達成した。第三に、許容フィルター(ゼロ平均、Mexican Hat DOG m = 2)は、同スケールの非許容ガウス型フィルターを上回り、両側FFTリークに対する部分的な保護を提供することが示唆された。第四に、両側FFTリークはスペクトルカバレッジに単調に比例し、ナローバンドフィルターがクリーンである一方、ワイドバンドフィルターはリーキーであるという相関が確認された。第五に、文字スケールでの因果的タイムドメインモルレーはBASE-DOTを超える性能を示さず、この結果がMorletQK論文における単語レベル実験の動機付けとなった。

これらの発見は、FourierQKがBERTのようなエンコーダースタイルの双方向アテンション設定において有効であることを示唆している。一方で、GPTのようなデコーダースタイルの自己回帰生成タスクには、MorletQKのような因果スペクトル変種が必要とされている。研究に関連するコードも公開されている。


参考: arXiv cs.LG (アーカイブ) — 2026年10月3日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn