Zihang Rui (Zihang Rui) 氏らは2026年9月29日(現地時間)、自律的なロボットの政策改善を目的とした新手法「スキルスペース・シューティング (Skill-Space Shooting)」に関する論文をarXivに公開した。同手法は、ロボットが新たな状況や失敗に遭遇した際に、人間の介入なしに学習し改善するためのもので、基盤モデル (foundation models) のガイダンスを活用し、再利用可能なスキルを通じて修正を探索する。

物理世界に展開されるロボットには、初期訓練を超えて改善する能力が求められる。特に、新たな状況や故障に直面した際に、各修正に対して人間のデモンストレーションを必要とせず、経験を効果的に活用できる改善手法が課題となっていた。

近年登場したエージェントシステムは、基盤モデルを用いて学習済み行動を自律的に組み合わせることでタスクを完了させる。しかし、この方法だけでは、ロボットが自身の失敗を克服するための政策学習には繋がらない。政策を改善するためには、これらの行動を学習可能な修正へと転換する必要がある。

Rui氏らは、多くの修正が「スキル」と呼ばれる短い行動であり、タスクを越えて再発し、基盤モデルがシーンから推論できる行動であるという着想を得た。この知見に基づき、同氏らは「スキルスペース・シューティング」を導入した。この手法は、基盤モデルのガイダンスを利用して、これらの再利用可能なスキルを通じて修正を探索し、成功した試行を政策改善に繋げる。

実世界での実験では、自律的に行動する政策の反復的な改善が示された。また、スキルを共有することで、新たなタスクでの改善に必要な訓練を削減できることも明らかになった。スキルを修正的監督の源とすることにより、スキルスペース・シューティングはタスク内およびタスク間においてスケーラブルかつ汎用的な政策改善を可能にする。追加の結果や動画は、ウェブサイト (https://skill-space-shooting.github.io) で公開されている。


参考: arXiv cs.RO (アーカイブ) — 2026年9月30日 02:59 (JST)

原文ハイライト

"Our insight is that many such corrections are familiar short behaviors, or skills"

この記事をシェア
X はてブ LinkedIn