大規模言語モデルの信頼性評価、わずかなプロンプト変化で回答不安定
arXiv cs.AIは2026年5月17日(現地時間)、「Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy」と題された論文を公開しました。この論文によると、大規模言語モデル (LLM) はベンチマークで高い精度を示すにもかかわらず、質問の言い回しがわずかに変わるだけで回答が不安定になる傾向があることが指摘されています。Kazem Faghih氏らが発表した本研究は、従来の精度指標だけではLLMが知識を適用する際の信頼性を十分に評価できない可能性を示唆し、新たな評価軸の重要性を強調しています。