arXiv cs.AIは2026年10月6日(現地時間)、論文『Agent in a Bottle: Can LLM Agents Turn Their Capabilities Into Cheap, Scalable Artifacts?』を公開した。同論文は、大規模言語モデル(LLM)エージェントが、高コストな個別のクエリを代替し、安価でスケーラブルなタスク特化型ソリューションを自律的に生成する能力、通称「bottling」を提唱。この能力を評価するため、新たにベンチマーク「BOTTLED」が導入されたと発表した。
この論文では、「bottling」を汎用的な能力を、応答品質と償却コストのバランスが取れたタスク特化型ソリューションに変える能力と定義している。導入されたベンチマーク「BOTTLED」は、エージェントがラベルなしのワークロード全体を受け取り、固定された時間、計算リソース、LLM APIの予算内でそれを完了することを求める。エージェントは、小規模モデルの訓練や再利用可能なプログラムの作成など、自身のアプローチを選択する。
10種類のモデルと3つのタスクにわたる評価では、強力なゼロショット性能が必ずしも強力なbottling能力に結びつかないことが判明した。類似したゼロショットスコアを持つモデル間でも、bottling後の性能に大きな差が見られ、60回のbottling実行のうち48回が、モデルのゼロショット性能の95%信頼区間の下限を下回った。また、60回の実行中31回は、同じトークン予算の小規模モデル蒸留ベースラインのより強力な方よりも低い性能を示した。
しかし、bottlingは大幅なコスト削減をもたらす可能性があることも示されている。クエリ・製品関連性分類タスクにおいて、Opus 5はゼロショットのマクロF1スコアの約82%を維持しながら、報告コストを約657分の1に削減した。さらに、安価で反復的な推論のために構築された「system one」モデルであるJevと比較しても、bottlingは競争力がある。同じタスクでOpus 5はJevのマクロF1スコアの約94%を回復し、予測されるフルワークロードコストはJevの4分の1であった。
BOTTLEDは、大規模で反復的なワークロードに対して、限定されたリソースを再利用可能なソリューションに投資するエージェントの能力を評価し、改善するための基盤を提供するものとしている。
参考: arXiv cs.AI (アーカイブ) — 2026年10月7日 02:57 (JST)