LLMエージェント評価に特化、閉ループベンチマーク「XiangqiBench」登場
arXiv cs.CLは2026年10月1日(現地時間)、大規模言語モデル(LLM)エージェントの閉ループ評価を目的とした新たなベンチマーク「XiangqiBench」を公開しました。このベンチマークは、静的な評価では不十分とされるLLMエージェントの計画完遂能力を測定します。中国象棋(シャンチー)の終盤戦を題材とし、エージェントが対戦相手のエンジン防御側に対して実際に詰み(チェックメイト)を達成できるかを評価基準とします。