SLVR、MLLMの視覚推論精度を向上させる新フレームワーク
arXivは10月1日(現地時間)、マルチモーダル大規模言語モデル (MLLMs) が視覚推論を行う際に、言語的先行知識に過度に依存する問題に対処する新しいトレーニングフレームワーク「構造化潜在視覚推論 (SLVR)」に関する論文を発表した。SLVRは、明示的な思考連鎖 (CoT) と潜在推論のギャップを埋め、プランニング、グラウンディング、証拠選択、推論統合といった定型化された潜在段階にマルチモーダル推論を組織化する。
Tag
1 件の関連記事