arXivは2026年9月30日(現地時間)、エージェントの自己改善を促すハーネス探索を自動化する新フレームワーク「Turbo Harness」を提案する論文を発表した。従来の最適化手法が単一のグローバルハーネスをタスクインスタンス全体に適用するのに対し、Turbo Harnessは最適化で得た情報を再利用し、各タスクインスタンスにハーネスを適応させる。このアプローチは、7つのベンチマークで既存の手法を上回る性能を示した。
arXivで発表された論文『Turbo Harness: Instance-Adaptive Harness Optimization』は、エージェントが再帰的に自己改善を行うためのハーネス探索を自動化する新しいアプローチ「Turbo Harness」を紹介している。従来のハーネス最適化手法は、タスクインスタンス全体に単一のグローバルハーネスを一律に適用するものであり、個々のインスタンスに最適なハーネスを提供できないという課題を抱えていた。
本論文で提案された「Turbo Harness」は、この課題を克服するため、完了したグローバルハーネス最適化の実行中に生成された情報を再利用する。具体的には、この情報が「構造化されたプレイブック」として要約される。次に、このプレイブックを活用して「ハーネスエディター」が訓練される。このエディターは、過去の最適化経験に基づいて、グローバルハーネスに対し、各タスクインスタンスに特化したパッチを生成する能力を持つ。
推論フェーズでは、訓練された「ハーネスエディター」が、個々のインスタンスの特性とプレイブックに格納された知識を用いて、そのインスタンスに完全にテーラードされたハーネスを構築する。このテーラードハーネスの上で実行モデルが動作することにより、ハーネスが全体としては良好でも、個々のインスタンスには最適ではないという従来の課題が効果的に解消される。これにより、特定の問題状況に対してより精緻で効果的な対応が可能となる。
研究チームは、「Turbo Harness」の有効性を検証するため、広範な数値実験を実施した。インタラクティブなエージェントタスク、ソフトウェアエンジニアリング、長期間のターミナルタスクといった多様なドメインにわたる7つのベンチマークにおいて、既存のハーネス最適化ベースライン手法と比較を行った。その結果、「Turbo Harness」はこれらのベンチマーク全てにおいて、既存手法を上回る一貫して優れた結果を達成した。
論文の著者は、チュンユ・チャン (Tunyu Zhang) 氏、ハオ・ワン (Hao Wang) 氏、カイ・シュウ (Kai Xu) 氏、ディミトリス・N・メタクサス (Dimitris N. Metaxas) 氏である。
参考: arXiv cs.AI (アーカイブ) — 2026年10月1日 02:56 (JST)