リサーチ・論文 · 10月10日 02:17 マルチモーダルLLMの視覚推論向上へ、新訓練源WOVEN登場 arXivは10月8日(現地時間)、論文を発表し、それによると、Zheyu Fan氏ら研究チームは、マルチモーダル大規模言語モデル(MLLM)が抱える空間的、身体的、物理的、時間的推論の課題に対応するため、新たな訓練データセットとベンチマーク「WOVEN」を導入した。WOVENは、これらの課題の根源に視覚的遷移推論の不足があるとの仮説に基づき開発された。