arXivは2026年9月30日(現地時間)、再帰構造を持つTransformerとMixture-of-Experts(MoE)を組み合わせたモデルのスケーリング法則「Loop Scaling Laws」に関する論文を公開した。Yanbei Chen氏らが執筆し、従来は再帰性とスパース性を別々に扱っていたスケーリング法則に対し、モデルサイズやデータ量と共に両特性を統合的に扱う枠組みを示した。

論文は、Yanbei Chen氏、Anirudh Goyal氏、Raghuraman Krishnamoorthi氏らが執筆した。Looped transformersとMixture-of-Experts(MoE)はそれぞれ効率的なスケーリングの手法として知られるが、既存のスケーリング法則はこの二つを個別に扱ってきた。両者は従来、それぞれ独立した効率化手法として研究されてきたが、モデルサイズやデータ量と合わせて同時に扱う枠組みはこれまで確立されていなかったという。今回の研究は、再帰性によって得られる有効パラメータの増加を特徴づけ、スパース性がこの増加をどのように高めるかを示した。

Loop Scaling Lawsは、Loopedモデルのホールドアウト損失を従来の手法よりも正確に予測するとしている。標準的な密結合モデルやMoEのスケーリング法則は、この新しい法則の特殊なケースとして再現される。これにより、計算量とメモリの制約下でLooped MoEモデルを設計するための基礎を提供するという。

下流タスクの評価では、スパース性がアクティブパラメータの効率を約3倍に高め、再帰性は推論タスクにおいて総パラメータの効率を約2倍に高めることが示された。再帰性とスパース性を共同でスケールさせることで、性能のフロンティアはさらに押し広げられるという。

実用規模での検証として、これらの効果が1兆トークン規模でも維持されることが確認された。同等のトレーニング計算量で比較した場合、法則から導出された再帰性を持つLooped MoEは、約2倍大きい非LoopedのMoEと推論ベンチマークで匹敵する性能を示した。論文では、この手法がテスト時のスケーリングにも対応できるとしている。これにより、推論時にループ回数を増やすなどして追加の計算資源を投入し性能を高める運用が可能になるとみられる。

論文はarXiv cs.LGに2026年9月30日付で掲載された。URLはhttps://arxiv.org/abs/2609.40316。


参考: arXiv cs.LG (アーカイブ) — 2026年10月1日 02:53 (JST)

原文ハイライト

"We introduce Loop Scaling Laws, the first scaling law to jointly model recurrence"

この記事をシェア
X はてブ LinkedIn