arXiv cs.CLが2026年9月25日(現地時間)付けで、大規模言語モデル(LLM)の自己学習における新たなデータ構築原則「戦略的多様性サンプリング」に関する研究論文を公開した。Alexander Gurung氏、Esmeralda S. Whitammer氏、Mirella Lapata氏らが執筆したこの論文は、LLMのトレーニングや推論で用いられる繰り返しサンプリングにおいて、従来の「正解性」を重視するデータ構築がモデルの既存戦略を過度に反映してしまう課題を指摘している。問題解決への多様なアプローチを含むデータを生成することで、自己学習の効率と性能を向上させる可能性を示している。

研究者らは、戦略的多様性 (strategic diversity)を自己学習データ構築の代替原則として調査した。これは、問題に対するアプローチ間の実質的な多様性を指す。戦略的に多様なデータを生成するために、二つの新しいサンプリング手法が開発された。

一つは「GROOT」と呼ばれる新手法で、アプローチの階層ツリーを構築し、異なるパスをサンプリングする。もう一つはVerbalized Sampling (VS)であり、非構造化されたアプローチセットを生成するように適応された。

これらの手法を用いて戦略的にサンプリングされたデータで訓練されたモデルは、競技プログラミング (competitive programming) および次章予測 (Next-Chapter Prediction) のドメインにおいて、従来のIID (independent and identically distributed) 訓練されたモデルよりも、困難なタスクで優れた性能を発揮することが確認された。また、強化学習 (RL) やテスト時スケーリングの強力な初期化も提供する。

特に、Qwen3-4Bのモデルから得られた、戦略的に多様だが誤ったトレースからの自己学習が、235Bの大規模な教師モデルからのIID蒸留を上回る結果を示した。これらの結果は、有用な自己学習データに関する既存の前提に課題を投げかけ、アプローチの多様性が正解性や教師の規模よりも重要である可能性を示唆している。


参考: arXiv cs.CL (アーカイブ) — 2026年9月26日 02:35 (JST)

原文ハイライト

"diversity of approaches can matter more than correctness or teacher scale."

この記事をシェア
X はてブ LinkedIn