ドンシェン・チェン (Dongsheng Chen) らは2026年9月26日(現地時間)、arXiv cs.CRで論文「SameFact: The Same Safety Facts Lead to Different Responses Across Interfaces」を公開した。同論文は、大規模言語モデル (LLM) の安全性評価において、モデルが特定のアクションを危険と認識していても、応答インターフェースの違いによって行動選択が変化する可能性を指摘している。同じ安全関連の事実が、インターフェースを越えてモデルの応答に与える影響を検証するため、SameFactベンチマークが導入された。
モデルの安全性評価では、特定のアクションの危険性認識が焦点となる。一方、エージェント評価では、モデルがどのような行動を選択するかが問われる。両者の間に、同じ安全関連の事実が異なる応答インターフェースを通じてモデルの行動選択にどのように影響するかという測定上の課題がある。
この課題を直接検証するため、SameFactベンチマークが開発された。これは、300の安全/危険ペアを含む整合性のある反実仮想的なデータセットである。このベンチマークは、タスク、事前観測、候補アクション、識別子、非ターゲット事実を固定し、単一の状態に基づいた安全事実のみを変更するよう設計されている。研究者らは、6つのLLMバックボーンを対象に、明示的な安全性判断、チェックポイント候補承認、およびオープンな初回アクション選択という3つのインターフェースを介して、この整合的な介入の効果を測定した。
分析の結果、6つのLLMバックボーンすべてにおいて、オープンな初回アクション選択時の応答が、安全性判断時の応答よりも総体的な感度が低いことが判明した。この変化は一様な減衰ではなく、24のモデル要因セル全体で、スピルマンの順位相関 (Spearman agreement) は安全性判断とチェックポイント承認間の0.817から、安全性判断とオープンな初回アクション選択間の0.470へと低下した。また、ペアワイズの順序不一致は18.5%から32.6%に上昇した。
追加で行われた2x2の初回応答実験では、チェックポイント式のプロトコルを用いることで、6つのバックボーンすべてで測定された感度が8.4〜29.3パーセントポイント増加することが示された。これらの結果は、応答インターフェースそのものが測定量の一部であるという見解を裏付ける。安全性判断インターフェースとアクションインターフェースは安全信号を共有するものの、安全関連の事実がモデルの応答を形成する方法について、必ずしも互換性のある測定値を提供するわけではない。
参考: arXiv cs.CR (アーカイブ) — 2026年9月30日 13:00 (JST)
原文ハイライト"SameFact: The Same Safety Facts Lead to Different Responses Across Interfaces"