arXiv cs.CLは2026年10月1日(現地時間)、大規模言語モデル(LLM)エージェントの閉ループ評価を目的とした新たなベンチマーク「XiangqiBench」を公開しました。このベンチマークは、静的な評価では不十分とされるLLMエージェントの計画完遂能力を測定します。中国象棋(シャンチー)の終盤戦を題材とし、エージェントが対戦相手のエンジン防御側に対して実際に詰み(チェックメイト)を達成できるかを評価基準とします。
XiangqiBenchは、エンジンまたは詰みのみの探索によって支援される119の戦術的な終盤戦シナリオから開始されます。LLMエージェントは、これらの状況でチェックメイトを成功させる必要があります。インタラクティブなREPLインターフェースを通じて、実際の手、状態クエリ、および前方シミュレーションが分離され、12の最先端LLMから8,568のマルチターンの軌跡が2つの観測プロトコルに基づいて記録されました。
評価の結果、見た目上の能力と実際の閉ループでの成功には3つのギャップが存在することが明らかになりました。第一に「Conversion Gap」として、モデルはSighted trialsの26.1%で参照される初手を指しますが、これらの試行で勝利に至るのはわずか13.9%でした。第二に「Consistency Gap」として、主要モデルはpass@3で38.7%に達するものの、pass^3では5.9%に留まり、46のポジション中、全3試行で勝利したのは7ポジションのみでした。第三に「Simulation Gap」として、受け入れられたシミュレーション呼び出しの32.3%が不正な手で停止し、比較可能なケースの49.3%では、実際の防御側がエージェントがシミュレートしたラインとは異なる応答を示しました。これは、自己生成のロールアウトが合法性をチェックできても、対戦相手の動きを予測できないことを示しています。
これらの結果は、指し手を見つけることとゲームに勝つことは同一ではないという見解を裏付けています。LLMエージェントの評価においては、閉ループの結果をスコア化し、カバー範囲と並行して信頼性を報告する必要があるとしています。
参考: arXiv cs.CL (アーカイブ) — 2026年10月5日 13:00 (JST)
原文ハイライト"Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents"