arXivは2026年10月8日(現地時間)、大規模言語モデル(LLM)が特定の価値観に合わせてファインチューニングされた際に、未知の価値観に対してどのように振る舞いを変化させるかを予測する「アライメント汎化予測」のタスクに関する研究論文を発表した。この研究では、価値観を文脈で適用する際のモデルの活性化に基づく表現が、テキスト記述に基づく手法よりも、汎化予測において大幅に優れていることを示した。
アンディ・リュウ(Andy Liu)氏、メハル・バティア(Mehar Bhatia)氏らがarXivに提出した論文によると、LLM開発者は、アライメントターゲットに列挙された親社会的価値観や行動特性を示すようモデルを後学習させている。しかし、最近の後学習技術の進展によりアライメント評価で高得点を出すモデルが得られている一方で、狭い行動セットでの学習が、未知のコンテキストや環境におけるモデルの行動に予期せぬ影響を与える問題を指摘した。
本論文では、この課題に対処するため「アライメント汎化予測」というタスクを確立した。これは、特定の価値観に従うようにモデルをファインチューニングすることが、幅広い未知の価値観にわたってその行動をどのように変化させるかを予測するものである。
研究チームは、現代のアライメントターゲットに見られる66の価値観にわたり、アライメント汎化効果の大規模な分析を実施し、この予測タスクにおける表現手法をベンチマークした。その結果、価値観をコンテキストで適用する際のモデルの活性化に基づく表現が、価値観のテキスト記述に基づく手法よりも大幅に優れていることを発見した。具体的には、最良の活性化ベース手法が汎化行列と0.45の相関を達成したのに対し、記述ベースのベースラインは0.05にとどまった。
さらに、アライメント汎化を予測するこれらの表現が、下流タスクにも適用可能であることを示した。多価値アライメントターゲット内の価値観がどれだけ類似しているかを測定するためにそれらを使用し、その類似性がモデルのロバストネスと有意に相関していることを明らかにした。最終的に、モデルに依存しない共有の価値空間に向けた初期的な証拠を提示し、経験的汎化ダイナミクスに基づいたLLM価値観の初の分類法を開発した。この研究は、LLMにおける価値汎化の研究の重要性、およびモデル行動のより経験的な設計とトレーニングへの応用を示唆している。
参考: arXiv cs.CL — 2026年10月9日 02:47 (JST)
原文ハイライト"representations based on model activations when applying values in context significantly outperform methods"