LLMコードエージェント評価の課題浮き彫り、QuoteBenchが実行パス失敗を検証
arXivは8月13日(現地時間)、大規模言語モデル (LLM) コードエージェントの評価において、実行スコアのみではコマンド生成後の実行パスで生じる失敗を適切に識別できないとする論文「QuoteBench: How Matched Scores Can Hide Command-Path Failures」を公開した。研究チームは、クオートベンチ (QuoteBench) と呼ばれる新たな評価手法を導入し、56のワンショットタスクと14のインシデント由来のファミリーを通して、生成契約と実行トランスポートの境界を測定している。