大規模言語モデルの選択的信頼を最適化、arXivが新手法提案
arXivは2026年8月6日(現地時間)、大規模言語モデル (LLM) が外部シグナルに過度に依存する問題に対し、誤解を招くコンテキストへの脆弱性を「選択的信頼」として捉え直し、これを最適化する新たな学習手法を提案する論文「Learning When to Trust via Selective Context Preference Optimization」を公開した。研究チームは、誤情報によってモデルの正答が誤答に変化する現象を評価するため、人間がアノテーションを付与したベンチマーク「MIST (ミスト)」と、誤情報による誤答への変化頻度を測るメトリクス「SC2W (エスシーツーダブリュー)」を導入した。