arXivは10月1日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) が視覚推論を行う際に、言語的先行知識に過度に依存する問題に対処する新しいトレーニングフレームワーク「構造化潜在視覚推論 (SLVR)」に関する論文を発表した。SLVRは、明示的な思考連鎖 (CoT) と潜在推論のギャップを埋め、プランニング、グラウンディング、証拠選択、推論統合といった定型化された潜在段階にマルチモーダル推論を組織化する。
既存のMLLMsは、視覚推論の質問に対し、タスクに関連する視覚的証拠よりも言語的先行知識に依存する傾向が見られる。テキストベースの思考連鎖(Chain-of-Thought、CoT)推論は、視覚に関する質問を中間的な証拠探索ステップに分解することでこの問題を部分的に緩和できるものの、これらのステップを自己回帰的に生成すると推論コストが増加する。
潜在推論は明示的な根拠生成を回避するが、既存のアプローチでは中間状態が何をエンコードするかに対する制御が限定的であり、プランニング、グラウンディング、証拠選択に対する個別の監督が困難であった。
SLVRは、回答を明らかにするテキストをマスクし、視覚的に妥当なディストラクター(誤答)と正答を対比させることで、モデルが画像に依存するように訓練する。その後、推論を潜在段階(プランニング、グラウンディング、証拠選択、統合)に整理し、各段階を対応するシグナル(計画、バウンディングボックス、視覚的証拠、最終的な推論)で監督する。これにより、推論時にテキストチェーンを生成することなく、潜在推論に明示的な機能構造を与える。
Qwen2.5-VL-7Bを基盤として構築されたSLVRは、マルチモーダル推論ベンチマークで一貫した改善を示している。MMVPでプラス9.4ポイント、BLINK Relationでプラス14.2ポイントの絶対的な向上を達成したほか、V*、MathVista、ChartQAでも性能改善が見られた。これらの結果は、構造化された潜在監督が、テキストCoTのデコードオーバーヘッドなしに、きめ細かい視覚推論を改善できる可能性を示唆している。
参考: arXiv cs.CV — 2026年10月9日 13:00 (JST)
原文ハイライト"SLVR: Structured Latent Visual Reasoning via Human-like Reasoning Flows"