ジアビン・チウ (Jiabin Qiu) 氏らの研究チームは2026年9月24日(現地時間)、arXiv cs.AIに論文を公開した。この論文では、モデル予測制御 (MPC) における候補行動の識別能力を高める「AD-WM」と呼ばれる行動識別型共同埋め込みワールドモデルを導入している。既存のワールドモデルが事実予測遷移の精度に注力する一方で、AD-WMは反事実的な行動選択に必要な差異の保持を重視する。OGBench-Cubeでの実験では、ハードスタート成功率を3.7%から52.0%に向上させ、Frankaセットアップではゼロショット転移の成功率を42.2%から71.1%に改善した。
AD-WMは、残差潜在ダイナミクスと予測子レベル行動回復正則化を組み合わせたモデルである。この正則化には、逆ダイナミクスと、条件付き相互情報量に動機付けられた正規化回復目的が用いられている。これらの目的は、計画遷移が行動情報を保持することを促すものであり、テスト時には補助ヘッドが破棄されるため、モデル予測制御 (MPC) は変更されない。
OGBench-Cube上での評価において、AD-WMは、LeWMベースラインと比較して、ハードスタート成功率を3.7%から52.0%に大幅に向上させた。また、再現されたベースラインと比較して、5つのシミュレーション環境のうち4つで平均成功率が改善された。計画診断の結果は、事実予測誤差や全バンク行動ランキングが閉ループ成功の順序に従わない一方で、CEM整合型エリート後悔が成功とより密接に関連することを示している。
さらに、凍結されたV-JEPA 2エンコーダとDROID後学習を組み合わせた場合、AD-WMはFrankaセットアップへのゼロショット転移性能も向上させた。ラボ固有の適応なしに、基本的なピック・アンド・プレースの成功率を42.2%から71.1%に高めている。これらの結果は、計画のためのワールドモデルが、事実予測精度のみを最適化するのではなく、反事実選択に必要な行動依存の差異を保持すべきであるという見方を示唆している。
参考: arXiv cs.AI (アーカイブ) — 2026年9月25日 02:59 (JST)
原文ハイライト"world models for planning should preserve action-dependent differences needed for counterfactual selection"