Apple ML Researchは2026年7月29日(現地時間)、ロボットの操作において多様な動作モードを可能にする新たな模倣学習フレームワーク「MoMo」を発表した。このフレームワークは、ロボットが操作タスクを正確に実行するだけでなく、タスク、物体、相互作用の状況に応じて行動を展開する方法を適応させることを目的としている。MoMoは、時空間行動トークナイザーと行動クローニングトランスフォーマーからなる2段階の模倣学習システムであり、タスクと連続的な動作モード条件を入力として受け取る。

この研究は、ロボットが多様な文脈で効果的に機能するために、実行レベルのバリエーションをタスク間で共有される再利用可能な行動要因として学習できるかという問いに答えるものである。MoMoは、時空間行動トークナイザーと行動クローニングトランスフォーマーで構成され、タスクと連続的な動作モード条件を入力とする。

6つの実ロボット操作タスクにわたる実験では、この動作モード条件を変化させることで、安定した、動的な、そして中間的な行動が生成され、これらは人間の評価者によって区別可能であった。これらの行動は、関節速度、加速度、エンドエフェクタのアプローチピッチにおいて差異を示した。また、MoMoは、単一のモードでのみデモンストレーションされたタスクにおいても、未見の要求されたモードを転送し、タスクの成功率をほぼ維持することを示した。

これらの結果は、未見のタスクとモードの組み合わせに対する合成的な汎化能力の証拠を提供し、動作モードが操作スキルを実行する方法を制御するためにタスク間で再利用可能であることを示唆している。この研究はユーハン・フー (Yuhan Hu) 氏、ユーグ・トーマス (Hugues Thomas) 氏、ペイデ・ファン (Peide Huang) 氏、ムーリ・シヴァプラプ (Mouli Sivapurapu) 氏、ブノワ・ランドリー (Benoit Landry) 氏、アルト・キヴィラ (Arto Kivila) 氏によって執筆された。


参考: Apple ML Research — 2026年7月30日 09:00 (JST)

原文ハイライト

"MoMo transfers the unseen requested mode while largely preserving task success."

この記事をシェア
X はてブ LinkedIn