Jinhao Zhang氏らは2026年9月25日(現地時間)、大規模言語モデル (LLM) の効果的なファインチューニングにおいて、人間が読解可能なテキスト形式が必須ではない可能性を示唆する論文をarXivで発表した。同研究では、モデルに最適化された訓練表現が、人間可読性を必要とせずとも適応性能を維持または向上させるかどうかに焦点を当てた。活性化勾配フィードバックを活用する合成データ生成手法「Desired-Update-Aligned Synthetic Data (DASA)」を提案し、その有効性を実証している。
Jinhao Zhang氏、Zeyu Liu氏、Zicheng Yan氏、Yunquan Zhang氏、Daning Cheng氏、Song Tang氏らによる研究チームは、フリーズされた参照モデルからの活性化勾配フィードバックを利用し、連続的な合成入力埋め込みの最適化を導くDASAの概念を提唱した。 DASAの主な目的は、ソーステキストの再構築や言語的流暢さではなく、有用な適応更新を生成することにある。この手法は、事前学習済みモデルの微細な更新方向を最適化し、望ましい振る舞いを引き出す合成データ埋め込みを直接生成する。
生成された埋め込みは直接下流のファインチューニングに利用され、その結果得られる離散トークンへの投影は、主に定性的な検査に限定される。実験は、10億から320億パラメータを持つLlamaとQwenファミリーの合計6つのモデルを用いて実施された。これらのモデルは、知識、数学的推論、コード生成、常識的推論にわたる6つのベンチマークで評価された。
一貫したLoRA適応設定の下で、DASAはソースの自然言語データに匹敵する性能を達成し、複数の構成でこれを上回る結果を示した。また、比較対象のベースライン手法であるGRADMMを、ほとんどの比較において凌駕した。さらに、汎用ドメインおよびタスク特化型ソースデータに関する広範な実験も実施されている。
評価された合成設定において、DASAはGRADMMと比較して3.6〜4.9倍の速度向上を実現し、GPUメモリのピーク使用量は同程度であった。これは、効率的なLLMファインチューニングのための新たな道筋を示唆しており、特にテキストデータが不足している場合や、特定のタスクに適した表現を直接学習させる場合に有効であると期待される。
参考: arXiv cs.AI — 2026年9月30日 13:00 (JST)