arXivは10月8日(現地時間)、論文を発表し、それによると、Zheyu Fan氏ら研究チームは、マルチモーダル大規模言語モデル(MLLM)が抱える空間的、身体的、物理的、時間的推論の課題に対応するため、新たな訓練データセットとベンチマーク「WOVEN」を導入した。WOVENは、これらの課題の根源に視覚的遷移推論の不足があるとの仮説に基づき開発された。
マルチモーダル大規模言語モデル(MLLM)は、視覚情報を伴う空間的、身体的、物理的、時間的推論において性能上の課題を抱えています。Zheyu Fan氏らの研究チームは、これらの課題が視覚的遷移推論の共通の不足に起因すると仮説を立て、この能力が多様な教師信号源から学習し、複数のタスクで再利用可能な共通の訓練プリミティブとして機能するかを検証しました。
既存のベンチマークがこれらの不足を個別に文書化する一方で、シーン、アクション、推論操作にわたる比較を十分にサポートしていませんでした。このため研究チームは、新たな訓練ソースおよびベンチマークである「WOVEN」を開発しました。WOVENは、20種類のシーンタイプ、5種類のアクションタイプ、8種類の推論タイプにわたる合計36,076の例で構成されています。動画の事前学習済み生成モデルから得られた多様で現実的なロールアウトを使用し、遷移の教師信号を整理しています。
研究チームはまず、GPT-5.4やQwen3-VL-235B-A22Bを含む38の主要なMLLMをWOVENで評価しました。その結果、これらのモデルは人間と比較して大幅かつ体系的な能力不足を示すことが判明しました。最も強力なモデルでさえ人間の性能を大きく下回り、この不足はモデルファミリー全体で繰り返し発生し、モデルの規模が大きくなっても解消されない傾向が確認されました。
次に、研究チームはWOVENを用いて複数の規模のMLLMを訓練しました。これにより、モデルが広範に転移する共通の能力を学習することが明らかになりました。約2,000項目という少量の訓練サブセットを使用しただけでも、評価対象の26の外部ベンチマーク中22で、最大27.3パーセントポイントの改善が見られました。さらに、WOVENデータは、特定のタスク自身の訓練データの30%から50%を同等の精度で置き換えられる効率性も示されました。
この研究は、視覚的遷移推論がMLLMにおける体系的な視覚的ワールドモデル訓練の再利用可能な基盤となることを確立しています。また、視覚的ワールドモデリングの訓練レシピとして、教師信号はアクション、シーン、ドメインではなく、教えるべき推論操作によって選択し、堅牢性を高めるために視覚状態へのより大きな変化を優先すべきであるという指針も提示しています。
参考: arXiv cs.CV (アーカイブ) — 2026年10月9日 02:52 (JST)
原文ハイライト"Weaving Visual World Modeling into Multimodal LLMs"