Apple ML Researchは2026年10月(現地時間)、複数環境にわたる汎用エージェントの訓練を目指す新しい手法「RISED (Rubrics for Agentic Multi-Environment Selection and Self-Distillation)」を発表した。この手法は、単一のLLMエージェントを多様な対話型環境で共同訓練する。従来のカリキュラムやデータ選択戦略が抱える、スカラー報酬の限定性といった課題への対処を目的としている。テキストフィードバックを活用することで、効率的かつ堅牢なエージェント学習の実現を目指す。

RISEDは、ロールアウトの行動を詳細に記述するルーブリックのような、豊かなテキストフィードバックの活用を重視している。従来の戦略では、環境レベルでの訓練割り当てや、局所的な報酬ベースの信号が優先され、プロンプトグループ選択における環境間のロールアウト関係が明示的に考慮されていなかった。また、環境ごとの学習速度の違いにより、バッチ内で全失敗と全成功のロールアウトグループが混在し、グループ相対的な報酬信号が得られないという問題も指摘されていた。

RISEDでは、ルーブリックを報酬としてだけでなく、オンラインのデータ選択とポリシーの教師の両方を導くために利用する。具体的には、LLMジャッジが、環境間で共有される事前定義済みのルーブリック語彙を用いて各ロールアウトにタグ付けを行う。これにより生成されたプロファイルは、混合環境バッチの全体的な行動構成に合致し、かつ既存の選択データとの重複を制限するデータの選択を誘導する仕組みだ。

さらに、望ましい行動を記述するポジティブルールは、オンポリシー自己蒸留教師に対し特権的なコンテキストを提供し、追加のトークンレベルの監視を供給する。一方、望ましくない行動を記述するネガティブルールは、繰り返される失敗モードから次のロールアウト生成を遠ざける役割を果たす。これらの構成要素が結合され、RISEDを形成する。

RISEDは、複数のモデルバックボーンにおいて環境全体で最高の平均パス率を達成し、個々の環境においても常に1位か2位にランク付けされた。ルーブリックベースの分析は、これらの改善に伴う行動の変化をさらに特徴づけることが可能であるとされている。


参考: Apple ML Research (アーカイブ) — 2026年10月6日 09:00 (JST)

この記事をシェア
X はてブ LinkedIn