arXiv cs.ROは2026年10月7日(現地時間)、ビジョン言語アクションモデル (VLA) が指示の言い回しに対し顕著な感度を示すとする研究論文を発表した。同論文は、VLAが基盤となるビジョン言語モデル (VLM) の言語ロバスト性を継承しておらず、一単語の変更でタスク成功率が大きく変動する事例を報告。この感度を特性評価し、ポリシー変更なしでその影響を低減する手法を提示している。

マイキー・ワッツ氏とユーチェン・ツイ氏らが発表したこの研究論文は、Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Modelsと題されている。

論文は、ビジョン言語アクションモデル (VLA) が、基盤となるビジョン言語モデル (VLM) の堅牢な言語処理能力を十分に継承していない点を指摘する。具体的な実験として、LIBEROストーブでのタスクにおいて、switch on the stoveという指示ではタスク成功率が100%に達したものの、わずか一単語を変更したswitch on the hot plateという指示では、成功率が2%にまで急落した事例を報告。また、再表現拡張でファインチューニングされた$\pi_0$チェックポイントでも、最大で61ポイントもの成功率変動が観測された。これは、VLAが指示の細かな言い回しに極めて脆弱であることを示唆している。

研究チームは、統計的にテストされた単一編集スイングとオラクルフレーズ検索を用いて、この言語感度を詳細に特性評価した。その結果、言い回しを最適化するだけで、分布内タスクと分布外タスク間のパフォーマンスギャップが21ポイント近く解消できることを実証した。この感度は系統的であるため、特定の明示的なルールとして表現可能であると結論付けている。

こうした感度に対する具体的な緩和策として、少数のトレーニングタスクについて多数の言い回しを評価し、その知見を大規模言語モデル (large language model) を用いて10から20程度の再表現ルールに抽出する手法を提案した。このルールは、VLAの展開時に、入力された指示を一度書き換える形で適用され、モデルのパフォーマンスを改善する。この手法は、モデルの再トレーニングやステップごとの検証を必要としないのが特徴で、未見のタスクや指示に対してもゼロショットで適用できる汎用性を持つ。

このルールを適用した結果、固定された$\pi_0$のパフォーマンスは、敵対的、VLM生成、人間生成の言い回しを含む12の未公開タスクにおいて、相対的に16%から27%向上した。特に、分布外タスクにおける改善が顕著であった。さらに、このパイプラインは$\pi_{0.5}$とLIBEROにおいても再現され、ファインチューニングの成功率を93.6%から97.8%へと向上させることに成功している。


参考: arXiv cs.RO — 2026年10月8日 02:57 (JST)

原文ハイライト

"Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity"

この記事をシェア
X はてブ LinkedIn