Microsoft Research Asiaは2026年10月7日(現地時間)、強化学習(RL)エージェントのトレーニングを効率化する新パラダイム「Harnessed Agentic RL」と、これを実装した軽量フレームワーク「Agent Lightning v1.0」をオープンソース化した。展開時に使用するエージェントハーネスをトレーニングに直接組み込むことで、トレーニングフレームワーク内でのエージェント再実装が不要となる。
Agent Lightning v1.0の主な特徴は、軽量設計、リアルハーネスとの統合、および完全で再現可能なエージェントRLトレーニングパイプラインである。フレームワーク全体のコードは約3,500行で構成されている。
ネイティブKubernetesサポートにより、エージェントは標準のKubernetesジョブとして実行可能であり、自己管理型クラスター、クラウドKubernetes、またはローカルインフラストラクチャ上で動作する。商用サンドボックスサービスへの依存はない。
データ効率の良いトレーニングレシピも特徴の一つである。Qwen3.5-9Bを用いたコーディングエージェントの例では、SWE-bench VerifiedにおけるPass@1スコアが41.8%から56.4%へと14.6ポイント向上し、約6,000のトレーニングサンプルのみでこれを達成した。
従来のAgentic RLでは、トレーニングフレームワークが環境とのインタラクションループを管理するため、開発者はトレーニングフレームワーク内でエージェントを再実装する必要があった。Harnessed Agentic RLは、LLMプロキシをエージェントとモデルの間に配置することで、既存のハーネスコードを変更せずにトレーニングを可能にする。
Agent Lightning v1.0のシステムは、API Gateway、Rollout Controller、Customized Trainerの3つのコアコンポーネントで構成され、シンプルな設計を第一としている。また、Collocated Async RLを導入し、ロールアウトとモデルの更新が同じGPUセットを共有することで、同期RLと比較してエンドツーエンドで約2倍の速度向上を実現した。
参考: Microsoft Research Blog (アーカイブ) — 2026年10月8日 01:00 (JST)
原文ハイライト"the same agent harness used in deployment participates directly in reinforcement learning"