arXiv cs.CL は2026年9月3日(現地時間)、「Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views」と題する研究論文を公開した。大規模言語モデル (LLM) が事前学習中に知識をどのように獲得するかという未解明な点に対し、知識の再構成である補助的ビューが学習に因果的に寄与すると提唱。実験を通じて、データ多様性の重要性を裏付けるメカニズムを報告した。

この論文は、Joseph Lee (ジョセフ・リー) 氏、Yidi Huang (イディ・ファン) 氏ら5名の研究者によるもので、EMNLP 2026のFindingsに採択された。研究では、制御された実験を通じて補助的ビューの効果を検証した。

まず、知識獲得には反復が必要であり、言い換え(paraphrasing)は小規模なバッチサイズでのみ有効であることが確認された。次に、トークン予算を固定した場合、文書の反復に割り当てるトークンの一部を補助的ビューに転用することで、事実想起(factual recall)においても学習が向上するという結果が得られた。この効果は直感に反するものとされている。

さらに、補助的ビューの有効性は、それらを生成する教師モデルの性能に依存しないことも示された。研究チームは、事前知識にギャップがある場合に学習を助ける文脈的知識(contextual knowledge)と基礎的知識(foundational knowledge)という知識の形式を特定した。これらの効果が、層ごとのバイアスと圧縮を通じてどのようにメカニズム的に現れるかについても分析が行われた。

これらの発見は、大規模な事前学習コーパスに自然に存在する知識の補助的な表現が、事前学習の成功における重要な要因であり、データ多様性が学習にとってなぜ重要なのかという疑問に対する説明を提供するものとしている。


参考: arXiv cs.CL (アーカイブ) — 2026年9月4日 02:57 (JST)

原文ハイライト

"auxiliary representations of knowledge, which arise naturally in large pre-training corpora, are a key factor"

この記事をシェア
X はてブ LinkedIn