arXiv cs.CLは2026年9月8日(現地時間)、Narges Mokhtari (ナルゲス・モクタリ)氏らの研究論文「Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling」を公開した。同論文は、Transformer(トランスフォーマー)ベースのマスク言語モデルにおいて、Attention(アテンション)メカニズムに代わる、低ランクボトルネックオートエンコーダを用いたデータミキシング手法を提案している。
本研究で提案された手法は、アテンションの代わりにオートエンコーダベースのミキシングモジュールを複数スタックする設計である。これらのモジュールは、埋め込み表現の局所的な近傍、シーケンス全体、およびアテンションヘッド間で機能するよう設計されており、入力データをボトルネックを通じて圧縮・再構築する。モジュールの幅は、モデルの性能と計算コストを調整するためのハイパーパラメータとして設定される。
特に、マスクされた位置のトークン予測に対しては、反復的な改善手順が導入されている。この手順は2つの主要なステップで構成されており、まず「pulling step」では、マスクされたトークンの埋め込み表現を、その周囲のコンテキストを示す近傍の加重平均に引き寄せる。次に「correcting step」として、結果として得られた埋め込み表現を、学習済みのデータマニホールドへとオートエンコーダを介して射影することで、より正確な表現を生成する。
評価は、C4データセットを用いた事前学習モデルで行われた。提案アーキテクチャは、パラメータ数が一致するBERT(バート)ベースラインと比較して、アテンションと同等の性能の大部分を、約1.9倍少ないFLOPs(浮動小数点演算回数)で達成した。また、頻度を考慮したトレーニングスケジュールを適用することで、最も出現頻度の低いトークンの頻度バケットにおいて、パラメータ数が一致するBERTおよびTinyBERT(タイニーバート)ベースラインと同等の性能を示しており、低頻度語彙に対するロバスト性も確認されている。この成果は、計算効率を高めつつ、既存の高性能モデルに匹敵する言語理解能力を実現する可能性を示唆している。
参考: arXiv cs.CL (アーカイブ) — 2026年9月28日 13:00 (JST)