arXivは2026年7月31日(現地時間)、論文「Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark」を公開しました。本研究は、エージェントシステムにおける推論および実行オペレーションの選択という課題に対し、実行可能なベンチマークと予算認識型メタ・ルーターを導入した成果を提示。このルーターは、生のタスクテキストから多様なオペレーションを効率的に構成する新たなアプローチを提案しています。
Natan Vidra、Alina Kapanova、Arun Kanhai、Spurthi Settyの4氏による本論文は、エージェントシステムが最終的な回答だけでなく、それに先行する推論や実行のオペレーションを自律的に決定する必要がある点を強調しています。従来のルーティング手法がモデルエンドポイント、検索深度、ツールといった要素を個別に選択していたのに対し、本研究では異種オペレーションを構成的に組み合わせる新しいアプローチを提案しました。
導入されたベンチマークは、データ分析、フローズンコーパス研究、ドキュメント処理といった広範な領域にわたる216の学習タスク、72の開発タスク、108のホールドアウトテストタスク、さらに108のロックされた語彙シフトチャレンジタスクで構成されています。オペレーション実行後には、その結果が機械的に正確に確認される仕組みです。
実験の結果、ホールドアウトテストにおいて、学習済みのポリシーは100%の成功率を達成し、強い静的および固定ワークフローの93.5%を上回る性能を示しました。また、静的ポリシーと比較してコストを43%削減したと報告されています。
一方、手つかずのチャレンジスプリットでは、学習済みの成功率は75.9%に低下し、静的ルーティングの93.5%を下回りました。しかし、この場合でもコストは49%低く、ワンショットルーティングと比較して34.3ポイント高い成功率を示しています。この成功率のギャップは、ルート実行能力ではなく、語彙的汎化能力が主な制限要因であることを示唆しています。本研究は再現可能なテストベッドと限定的な概念実証を確立するものであり、実稼働LLMの性能を直接示すものではないとされています。
参考: arXiv cs.LG (アーカイブ) — 2026年8月4日 13:00 (JST)
原文ハイライト"Learning Compositional Meta-Routing for Agentic Workflows"