Apple ML Researchは2026年8月25日(現地時間)、生成言語モデルの事前学習における「拡大と枝刈り (enlarge-and-prune)」パイプラインを統合する新たな手法「IDEA Prune」を発表した。大規模言語モデルの限られた推論予算内で効率的かつ展開可能なモデルへの需要が高まる中、従来の枝刈り研究でしばしば無視されてきた拡大モデルの事前学習の統合を提唱している。研究チームは、拡大モデルが展開されない場合でも事前学習の価値があるか、および枝刈りモデルの性能向上に向けたパイプライン全体の最適化方法という2つの重要な課題に取り組んだ。

研究チームが提案するIDEA Pruneは、拡大モデルの訓練、枝刈り、回復を単一のコサインアニーリング学習率スケジュールのもとで組み合わせる統合パイプラインである。このアプローチは、パラメータの段階的な除去を目的とした反復的な構造化枝刈り手法によって補完されている。

この手法は、ナイーブな拡大と枝刈りパイプラインにおいて学習率の上昇によって引き起こされる知識損失を軽減し、生き残ったニューロン間でモデル容量を効果的に再配分することを可能にする。これにより、スムーズな圧縮と性能の向上が促進される。

実験では、2.8Bモデルを1.3Bに圧縮するプロセスを最大2兆トークンで事前学習中に実施した。この統合されたアプローチは、拡大モデルの事前学習におけるトークン効率に関する洞察を提供するだけでなく、枝刈りされたモデルにおいて優れた性能を達成することを示した。


参考: Apple ML Research — 2026年8月26日 09:00 (JST)

原文ハイライト

"incorporating enlarged model pretraining, which is often ignored in previous works, into pruning."

この記事をシェア
X はてブ LinkedIn