Apple ML Research(アップル・エムエル・リサーチ)は10月(現地時間)、自己生成フィードバックを用いた強化学習の新手法「RLTL;DR(アールエルティーエル・ディーアール)」に関する研究成果を公開した。本手法は、困難なタスクにおいてエージェントが自らフィードバックを生成し、それを内部化することで学習効率を向上させるアプローチを提示。既存手法では学習が困難だったデータセットにおいて、RLTL;DRはPass@1で最大31%の性能改善を記録した。
強化学習における一般的なパラダイムであるRLVR(Reinforcement Learning with Verifiable Rewards、アールエルブイアール)は、エージェントがタスクに複数回挑戦し、成功した試行に基づいて最適化を進める手法です。しかし、教師モデルや例示解が存在せず、成功の可能性が低い極めて困難な自己改善タスクにおいては、このアプローチが課題となります。
Appleの研究者らは、この課題に対応するためRLTL;DRを導入しました。この手法では、エージェントが失敗した試行ごとに、検証器の出力を基にTL;DR(ティーエル・ディーアール)形式の簡潔なインサイトを自己生成します。次のロールアウトはこの過去のインサイト全てに条件付けされ、解決策が見つかるまで順次ロールアウトがサンプリングされます。さらに、インコンテキストのインサイトに対してバックプロパゲーションを可能にすることで、タスクからインサイトへの直接的なマッピングを内部化します。
難易度の高いツールコーリングおよびコーディングのデータセット(Pass@128が0にフィルタリングされたもの)を用いて、RLTL;DRの有効性が検証されました。このデータセットでは、Qwen 3.5 9B Thinking policy(クウェン 3.5 9B シンキング・ポリシー)の標準GRPO(ジーアールピーオー)トレーニングではPass@1が0%から1%で停滞しました。対照的に、RLTL;DRは学習障壁を突破し、トレーニング時にインサイトがコンテキストにある場合でPass@1が14%から31%、評価時にインサイトがコンテキストにない場合でも12%から13%を達成しました。
研究チームは、この性能向上の鍵がタスクからインサイトへの内部化にあると特定しています。このメカニズムをさらに検証するため、研究者らはアプローチをSFTL;DR(エスエフティーエル・ディーアール)に簡略化しました。これは(タスク、インサイト)の組のみで学習を行い、ロールアウトの表示やバックプロパゲーションを行わない手法です。わずか4,000組のタプルでの学習により、RLTL;DRやフルロールアウトを用いた古典的なSFT(エスエフティー)とほぼ同等の性能が回復しました。この結果は、on this sort of task, keep this sort of thing in mindという簡潔なトレーニングパラダイムの可能性を示唆しており、将来の研究に影響を与える可能性があると見られます。
参考: Apple ML Research — 2026年10月1日 09:00 (JST)
原文ハイライト"on this sort of task, keep this sort of thing in mind"