arXiv cs.AIは2026年9月30日(現地時間)、論文を通じて、大規模言語モデル(LLM)が長期間にわたるツール利用を行う際の性能向上を目指す新手法「Comparative Inference for Tool-use Agents (CITA)」を提案しました。この手法は、次に実行するツール呼び出しの長期的な価値を推定するモデルを訓練し、複雑なタスクにおけるエージェントの決定能力を強化します。

Yu Li氏ら6名の著者による論文Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agentsは、大規模言語モデル(LLM)が複雑なタスクで長期間にわたるツール呼び出しシーケンスに依存する際に生じる課題に対応しています。各ツール呼び出しはタスクの状態を変化させ、その後の決定に影響を与えるため、最終的な結果に基づく報酬だけでは、長期間の相互作用における適切な報酬割り当てが困難でした。

提案されたCITAは、Comparative Inference Model (CIM) を訓練します。このCIMは、観測されたツール動作、ベイジアンツールグラフシミュレータからのスケーラブルな教師信号、およびLLMに基づく比較からの意味的判断を組み合わせたペア信号から学習します。これにより、CIMは現在のコンテキストにおいて、実行可能な次のツール呼び出しが最終的なタスク成功をどの程度サポートするかを推定できるようになります。

CITAを3つのツール利用ベンチマークと複数のバックボーン大規模言語モデルに適用した結果、Tool F1とタスク成功率が一貫して向上しました。追加の分析では、CIMが比較ツール選択のための正確なステップレベルの価値推定を学習することが示されています。本研究はNeurIPS 2026 Posterとして発表されました。


参考: arXiv cs.AI — 2026年10月5日 13:00 (JST)

原文ハイライト

"Comparative Value Estimation for Long-Horizon Tool-Use Agents"

この記事をシェア
X はてブ LinkedIn