Apple ML Researchは2026年9月30日(現地時間)、自律的な機械学習エンジニアリング(MLE)エージェントに関する研究論文を公開した。論文は、マルチエージェントオーケストレーターや専用の検索サブエージェントといった精巧な仕組みを備える現行のMLEエージェントの有効性に疑問を投げかけ、最小限のハーネスを持つコーディングエージェントが、オープンソースの最先端ハーネスと同等以上の性能を発揮し得ると指摘した。
研究論文の執筆陣は、Kirill Brilliantov氏、Alejandro Hernández-Cano氏、Emmanuel Abbé氏の3名。論文「How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?」は、大規模言語モデル (LLM) のプリミティブを介して実行環境に直接アクセスする、構造が単純で改良を加えたコーディングエージェントの活用に着目した。
研究チームは、同一の時間予算と同一のフロンティアLLMバックボーンの条件下で、オープンソースの最先端ハーネスと、最小限のハーネスのみを備えたコーディングエージェントの単一セッションを比較した。結果に優位な差は見られず、性能を左右する主因はLLMバックボーン自体にあるとの見解を示した。
論文では大規模かつ体系的なアブレーション実験も実施された。マルチエージェントオーケストレーターや専用の検索サブエージェントといった機構層を段階的に取り除いて性能を比較したところ、こうした機構層はコーディングエージェントの設定において冗長になる傾向が確認されたという。強力なモデルの周囲に手作業で精巧なハーネスを構築する取り組みは、現行のMLEベンチマークに対し限定的な成果しかもたらさないと結論づけた。
関連研究として、継続的学習エージェントの訓練・評価基盤「SCLATE」と、インターフェースエージェントのユーザーエクスペリエンスをプロトタイピングするための足場を扱う「AgentBuilder」の2件が紹介されている。
今回の指摘は、マルチエージェント構成や専用検索サブエージェントの追加実装を前提としてきたMLEエージェント開発の方向性に再考を促す可能性がある。論文はApple ML Researchのサイト (https://machinelearning.apple.com/research/harness-autonomous-ml-engineering) で公開された。
参考: Apple ML Research (アーカイブ) — 2026年10月1日 09:00 (JST)
原文ハイライト"open-source state-of-the-art harnesses provide no advantages over a single session"