arXiv cs.AIは2026年9月3日(現地時間)、ハウヤン・チュー氏とジエ・チャン氏による研究論文を公開した。同論文は、大規模言語モデル(LLM)の性能を評価するオブザーバーの信頼性に課題があることを明らかにした。具体的には、同じモデル名に対し同一のリクエストを送信しても、異なる評価結果が返される事例が確認され、LLM評価の基本的な前提が維持されないと指摘している。
チュー氏とチャン氏は、事前登録された2つのキャンペーンを通じ、LLM評価の基盤となる同じリクエストが同じモデル名に送られた場合、常に同じ読み取り結果が返されるという仮定を検証した。その結果、52,988件のリクエスト試行において、この仮定が維持されないことが判明した。
詳細なデータでは、同一ウィンドウ内での繰り返しランキングにおいて、スピアマン相関係数が要求値の0.90に対し0.400に留まった。さらに、翌日のバイト単位で同一のリプレイでは、要求値0.99に対し0.78という結果だった。いずれのケースでも、実行記録は上限に達していた。
研究では、この信頼性のギャップを説明する主要なメカニズムとして、以下の3点を挙げている。第一に、ラベルと意味のマッピングが、シグナルと同程度に測定結果を偏らせること。第二に、候補間のギャップが、測定器自体のノイズフロアよりも7桁低いこと。第三に、バイト単位で同一の入力であっても異なるランキングが返されるノイズが存在し、これが厳密な順列読み取りによってさらに複雑化する点である。
また、メトリックの置換やサンプリングといった一般的な手法を用いても、テストされた評価グリッド上での問題は解決されなかった。その後の追跡調査では、評価の待機期間を延長しても改善は見られず、プロバイダーを切り替えても結果は同様だった。バッチ不変カーネルでの自己ホスティングは、サーバーがアイドル状態の場合にのみ有効であることが示されている。
これらの結果を踏まえ、論文は3段階のスナップショット・アイデンティティ・ラダー、8つの設計ルール、および報告チェックリストを提示している。すべての結果は、共有サービングインフラストラクチャ上の外部測定された動作に関するものであり、共有エンドポイントにおいてはモデル名が固定された測定器ではないと結論付けている。
参考: arXiv cs.AI (アーカイブ) — 2026年9月4日 02:59 (JST)
原文ハイライト"Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers"