Zixiang Xu (ジクシアン・シュー) 氏は2026年9月24日(現地時間)、論文「JevOut: Natural Context Can Flip Decision Models」をarXiv cs.CLで公開した。同論文は、専用の意思決定モデルが、自然な背景情報や周辺コンテキストの短い追加によって、初期の正しい判断を誤った方向に誘導される可能性があると指摘している。複数のモデルでこの脆弱性が確認され、特に高信頼度で誤った選択を導き出すケースも報告された。

意思決定モデルは、非構造化言語を有限の選択肢に対する確率分布にマッピングし、要求のルーティング、ツールの選択、アクションのトリガーを直接実行できる機能を持つ。しかし、現実世界からの入力は、通常、独立してではなく、背景詳細や周辺コンテキストを伴って与えられる。

ジクシアン・シュー氏の研究では、自然にフィットする短い追加コンテキストが、元の正しい判断を、正しい答えが変わらない場合でも誤った方向に誘導し得ることが示された。この行動を研究するため、初期に正しく判断された各項目に対し、誤ったターゲットオプションを固定。モデルのオプション確率を利用して、ソース、質問、選択肢、正解を維持しつつ、流暢なコンテキストの追加を精錬した。

64のターゲット評価において、最適化プロセスは、508の初期正答の決定のうち312件(61.4%)でモデルのジェブ (Jev) をリダイレクトするコンテキストを特定した。このうち229ケースでは、ジェブは固定された誤ったオプションに少なくとも0.7の確率を割り当てた。さらに、7つのデータセットにわたる3つの追加の意思決定システムも、初期に正しく回答した決定において、64.9%から73.2%の範囲でターゲットのフリップ率を示した。

これらの結果は、現在の意思決定モデルに顕著な脆弱性があることを示している。短く、普通に見えるコンテキストが、正しい選択を高信頼度の誤った選択へと変える可能性があるという。これらのモデルは言語を直接下流の選択肢に変換するため、この感度は確率出力を信頼できる意思決定インターフェースとして扱うことへの懸念を生じさせている。


参考: arXiv cs.CL — 2026年9月25日 02:57 (JST)

原文ハイライト

"short, ordinary-looking context can shift a correct choice to a high-confidence wrong one."

この記事をシェア
X はてブ LinkedIn