arXivは2026年9月29日(現地時間)に公開された論文「Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI」で、AIエージェントのテスト時における性能向上に関する研究成果を発表した。本研究は、Builder(構築者)がTarget(対象)エージェントのために、モデルの重みを固定したまま、より良い実行環境を学習・構築する方法を探る。経験の再利用性を高めるため「Meta-Skill」という概念を導入した。
論文は、エージェントのパフォーマンスが推論能力とそれが動作する環境の両方に依存すると指摘している。本研究では、テスト時AI-for-AI(AI4AI)の枠組みで、BuilderがTarget向けに実行環境を構築する際に、モデルの重みを固定したまま、その環境を改善する方法を検証した。
Builderが経験を再利用できるようにするため、「Meta-Skill」という原則が導入された。これは、いつサポートが必要で、どのようなリソースを提供すべきかを明確にするものである。Builderは、Targetの実行フィードバックからこれらの原則を学習し、凍結されたスキルバンク(frozen skill bank)を用いて、未確認のタスク向けにハーネス(harnesses)を構築する。
Harness-BenchとNewtonBenchの両ベンチマークを用いた評価では、フルバンクのMeta-Skillを適用した場合、スキルなしでの構築と比較してマクロ平均パフォーマンスが8.95パーセンテージポイント向上した。また、同じスキルバンクをTargetに直接提供した場合と比較しても、12.02ポイントの改善が見られた。
これらの結果は、経験を実行可能なサポートに変換することの価値を示している。同じモデルがBuilderとTargetの両方の役割を果たす場合にも性能向上が見られ、これはより良い環境を学習・構築することを通じたシステムレベルの自己改善の可能性を示唆している。論文の著者はチェン・チアン (Cheng Qian) 氏、クンルン・ジュ (Kunlun Zhu) 氏、ベイビン・リー (Beibin Li) 氏、ジェンハイロン・ワン (Zhenhailong Wang) 氏、ヘン・ジー (Heng Ji) 氏である。
参考: arXiv cs.AI (アーカイブ) — 2026年9月30日 02:55 (JST)
原文ハイライト"Meta-Skill: principles specifying when support is needed and what resources to provide."