Apple ML Researchは2026年9月(現地時間)、継続学習エージェントのトレーニングと評価を目的とした実行基盤「SCLATE」を発表した。この基盤は、既存のベンチマークやトレーニングフレームワークが抱えるカスタムスケジューリングループの課題を解決するため、ベンチマークとエージェントが共通のイベントスケジューラにイベントを追加する機能を提供する。これにより、長期間にわたる複数セッションのシナリオを効率的にシミュレートすることが可能となる。

「SCLATE」は、モデル、ハーネス、メモリから構成される継続学習エージェントシステムの評価とトレーニングを効率化するために開発された。従来のフレームワークでは、各ベンチマークが独自のイベントのみをスケジューリングしており、個々のベンチマークとエージェントの組み合わせごとにカスタムのスケジューリングループを構築する必要があった。この手法は開発コストが高く、柔軟性に欠けるという課題を抱えていた。

SCLATEは、アダプターを介してベンチマークとエージェントが共有のイベントスケジューラにイベントを追加できる設計を採用している。このシステムの中核を成すのはハイブリッドシミュレートクロックであり、共有タイムライン上でこれらのイベントを実行する。エージェントが活動している間はリアルタイムで進行し、アイドル状態のギャップはスキップされるため、理論上1ヶ月に及ぶシナリオであっても、数時間に圧縮して実行することが可能となる。この時間効率性は、特に長期的な継続学習の評価において大きな利点となる。

また、SCLATEは、任意のハーネスとメモリをそのまま実行できるロールアウトエンジンとしても機能する。この機能により、開発者は既存のコンポーネントを容易に統合し、評価プロセスに組み込むことができる。さらに、すべてのモデル呼び出しにおけるトークンとログ確率が自動的に記録されるため、詳細な分析とデバッグをサポートする。

Apple ML Researchは、SCLATEの有効性を検証するため、7種類のベンチマークをSCLATEに移植し、10種類のハーネスとメモリ構成、そして10種類のモデルを組み合わせた比較評価を実施した。この広範な比較の結果、追加のメモリシステムがハーネスのネイティブメモリを常に上回るわけではないこと、そして同じハーネスとメモリを使用しても、モデルによってその活用方法が大きく異なることが明らかになった。

加えて、特定のケーススタディとして、Qwen3.5-4Bモデルをハーネスとメモリシステムを使って事後トレーニングした。このトレーニングの結果、モデルはファイル読み込み行数を6.8倍削減することに成功し、開発者向けの評価基準であるSWE-bench Verifiedの合格率を16.7ポイント向上させた。同時に、より豊富なメモリレコードを書き込む能力を獲得し、MetaClawの精度は最大で11.8ポイント上昇した。


参考: Apple ML Research (アーカイブ) — 2026年9月30日 09:00 (JST)

原文ハイライト

"A Substrate for Continual-Learning Agent Training and Evaluation"

この記事をシェア
X はてブ LinkedIn