LLM安全性評価、インターフェースで応答差 同じ事実でも
ドンシェン・チェン (Dongsheng Chen) らは2026年9月26日(現地時間)、arXiv cs.CRで論文「SameFact: The Same Safety Facts Lead to Different Responses Across Interfaces」を公開した。同論文は、大規模言語モデル (LLM) の安全性評価において、モデルが特定のアクションを危険と認識していても、応答インターフェースの違いによって行動選択が変化する可能性を指摘している。同じ安全関連の事実が、インターフェースを越えてモデルの応答に与える影響を検証するため、SameFactベンチマークが導入された。