リズヒ・ヤン (Lizhi Yang) 氏らは10月8日(現地時間)、テキスト条件付きモーション生成器が抱える安全性課題に対処する新技術「Contextual Safety Filtering (CSF)」を発表した。このトレーニング不要のフィルターは、従来の安全対策では考慮されなかったシーンの文脈に応じた動作の意味の変化を克服。自然言語による安全ルールを適用し、ロボットが引き起こす危険動作を大幅に削減しつつ、良性動作の維持を可能にする。
モーション生成器は、人間やロボットの全身動作をシミュレートし、多様な行動パターンを生み出す技術として注目されている。しかし、これらの生成器には、対象が物体か人物かといったシーン固有の安全性の概念が欠けているという課題が存在していた。従来の安全対策は、プロンプトの検査や事前にラベル付けされた動作データの要求、あるいは幾何学的制約の強制にとどまり、シーンの文脈によって動作の安全性がどのように変化するかを直接考慮しないため、現実世界での応用には限界があった。
今回発表されたContextual Safety Filtering (CSF) は、このような既存の課題を解決するために設計された、トレーニング不要のフィルターシステムである。CSFの核となるのは、自然言語で記述された安全ルールを、生成器によって作成された安全および危険な参照軌道に grounding するメカニズムだ。このアプローチにより、特定のシーンにおける動作の危険度を文脈的に評価し、潜在的な事故を未然に防ぐことが可能になる。
具体的には、アクティブな各安全ルールに対し、CSFは安全な動作と危険な動作の参照軌道を定義し、これらを用いて「アフィン安全値」を算出する。この安全値を強制するために、Control Barrier Function Quadratic Program (CBF-QP) を基盤とする安全参照追跡システムが導入されている。これにより、生成されたモーションが常に安全基準を満たすように調整される。
異なるアーキテクチャを持つ4つの事前学習済み生成器を用いた広範な評価が行われた結果、CSFの有効性が証明された。実験では、CSFが明示的またはシーンによって誘発される全ての危険なケースで意図されたルールを正確に活性化させることが確認された。その結果、危険イベントの発生率は最大で90%削減されながらも、88%から100%の良性動作は維持されており、実用性と安全性の両立に成功している。
さらに、実世界での実証実験として、ユニットリー・ジーワン (Unitree G1) ロボットにCSFシステムを適用した。人間や物体との相互作用を含む様々な複雑なシナリオにおいて、CSFは危険な動作を成功裏に防止した。
参考: arXiv cs.RO — 2026年10月9日 02:59 (JST)