オクティ・チャン (Octi Zhang) 氏ら複数の研究者は2026年10月8日(現地時間)、ロボット制御における強化学習 (RL) のデータ探索ボトルネックを解決する新手法「Success Guided Sampling (SGS)」に関する論文をarXivに発表した。同手法は、並列シミュレーション環境での学習効率を向上させ、大規模なロボットタスクへの適用を可能にする。

汎用ロボットは、敏捷な移動から器用な操作まで、幅広いタスクを実行する必要がある。シミュレーションで学習した知識を実世界に転移させる「シム・ツー・リアル強化学習」は有効な手段とされているが、従来のRLパイプラインは、報酬の整形やデモンストレーションといった、タスクごとのエンジニアリング負担が大きい課題を抱えていた。

研究チームは、この課題を解決するため、SGSを開発した。これは、ポリシーの能力の限界にあるタスク設定にRLトレーニングを集中させる適応型サンプリング手法である。既存の手法では、多様なシミュレーターリセットと大規模な並列シミュレーションを組み合わせることでエンジニアリング負担を軽減できるとされてきたが、単純にこのアプローチをより精密または動的な問題に適用すると、均一なサンプリングが既に習得済みか、まだ試行できないタスク構成に学習経験の大部分を浪費するという問題があった。

SGSを導入することで、研究チームは、バッチ内の経験を最大限に活用し、大規模並列シミュレーションへの効果的なスケールアップを実現したと報告している。実験では、最大2の20乗(100万以上)の並列環境を使用し、SGSが、従来のメソッドでは解決できなかった多地形四足歩行ロボットの移動や、接触の多い組み立てタスクといった困難な問題をRLが解決できることを示した。さらに、学習された操作ポリシーはRGBベースのポリシーに蒸留され、実機におけるいくつかの困難な組み立てタスクでゼロショット転移が実証された。


参考: arXiv cs.RO — 2026年10月9日 02:59 (JST)

原文ハイライト

"Success Guided Sampling (SGS), a simple adaptive sampler that concentrates RL training"

この記事をシェア
X はてブ LinkedIn