arXivは2026年8月6日(現地時間)、大規模言語モデル (LLM) が外部シグナルに過度に依存する問題に対し、誤解を招くコンテキストへの脆弱性を「選択的信頼」として捉え直し、これを最適化する新たな学習手法を提案する論文「Learning When to Trust via Selective Context Preference Optimization」を公開した。研究チームは、誤情報によってモデルの正答が誤答に変化する現象を評価するため、人間がアノテーションを付与したベンチマーク「MIST (ミスト)」と、誤情報による誤答への変化頻度を測るメトリクス「SC2W (エスシーツーダブリュー)」を導入した。
MIST (ミスト) ベンチマークは、各推論項目をクリーンなコンテキスト、誤解を招くコンテキスト、正しいコンテキスト、無関係なコンテキストの4つの条件でレンダリングすることで、モデルの選択的信頼能力を包括的に評価する。この広範なベンチマーク調査の結果、一般的な大規模言語モデルに誤情報への普遍的な脆弱性が存在することが確認され、モデルが与えられたコンテキストを盲目的に信頼してしまう傾向が浮き彫りになった。
研究チームは、この問題に対処するため、選択的にコンテキストを信頼させるための手法「SCOPE (スコープ)」を提案した。SCOPEは、クリーンなコンテキストでは正答するにもかかわらず、誤解を招くコンテキストで誤答する特定の失敗事例を効率的に特定することから始まる。この特定された失敗事例を基に、SCOPEは人間の選好データを学習するDirect Preference Optimization (DPO) objective を応用し、モデルを最適化する。この最適化プロセスは、誤解を招く項目のみに限定されることなく、MISTの四つの条件全てにおいて、モデルがより信頼できる情報源を選択し、誤った情報源を無視するように設計されたバランスの取れた選好ペアに基づいて実行される。これにより、モデルは単に誤情報に対する耐性を高めるだけでなく、コンテキストの質を判断し、選択的に信頼する能力を獲得することが期待される。
SCOPEを適用した実験では、一般的なオープンソースモデルにおいて、誤情報によって正答が誤答に変化する頻度を測るメトリクスであるSC2Wが大幅に削減されることが示された。同時に、追加されたコンテキストがクリーン、正しい、または無関係である場合には、モデルの精度が維持されることが確認された。これは、SCOPEがモデルの有用性を損なうことなく、その信頼性を向上させることを意味する。本研究は、将来の大規模言語モデルの評価において、単なる堅牢性や耐性だけでなく、コンテキストの質に応じた選択的な信頼性も考慮すべきだと主張している。論文の著者には、Xian Sun、Wei Choe、Yingshuo Wang、Junhao Liu、Wei Gao、Qing Wu、Lingdong Kongの各氏が含まれる。
参考: arXiv cs.CL (アーカイブ) — 2026年8月7日 02:59 (JST)