arXiv cs.AIは2026年10月1日(現地時間)、マルチモーダルモデルの推論能力を大幅に引き出し、多様な対話型環境でタスクを解決するビジュアルハーネス「VISTA(ビスタ)」に関する論文を公開した。VISTAは一般的なマルチモーダルモデルに長期的な視覚を与え、視覚的な観測を通じて環境を直接認識させる。ロスレス視覚メモリにより過去の観測を元の形式で保持し、モデルが推論中に視覚入力を再編成することも可能だ。ARC-AGI-3ベンチマークでは、Claude Opus 5.0のRelative Human Action Efficiencyスコアを100.00に向上させ、人間よりも57.4%少ないアクションで25の公開ゲームを完了した。
ビジュアルハーネス「VISTA」は、そのシンプルな設計により、マルチモーダルモデルが本来持つ強力な推論能力を最大限に引き出すことを目指している。このフレームワークは、最小限の適応で多様な視覚環境へと自然に拡張可能であり、多岐にわたる対話型タスクの解決に貢献する。
VISTAの核心は、マルチモーダル大規模言語モデル (MLLMs) に「長期的な視覚センス」を付与する点にある。これにより、モデルは単一の瞬間的な視覚情報だけでなく、時間の経過とともに変化する環境の連続的な観測を効果的に統合できる。具体的には、VISTAはロスレス視覚メモリを介して過去の観測をオリジナルの形式で保持し、必要に応じてこれらの視覚入力を再編成・再利用することを可能にする。これは、複雑な推論や長期的な計画を必要とするシナリオにおいて、モデルがより深い理解と効率的な意思決定を行う上で極めて重要となる。
論文では、VISTAの性能を複数のベンチマークで評価した。特にARC-AGI-3ベンチマークにおいて、VISTAは既存のマルチモーダルモデルであるClaude Opus 5.0のRelative Human Action Efficiencyスコアを劇的に改善し、100.00を達成した。これは、モデルが人間よりも57.4%少ないアクションで25の公開ゲームをクリアしたことを意味する。さらに、VISTAは多様な視覚ゲームやパズルをカバーする3つの追加ベンチマークにおいても、同じ基盤モデルと最小限のハーネスを使用するベースラインと比較して、大幅に優れた性能を発揮した。これらの結果は、VISTAが複雑な視覚環境におけるマルチモーダルエージェントの能力を進歩させる、汎用性の高いビジュアルハーネスとしての大きな可能性を強く示唆している。
この画期的な研究は、Qiushi Han氏、Keya Hu氏、Linlu Qiu氏、Cathy Wu氏、Kaiming He氏によって執筆された。
参考: arXiv cs.AI — 2026年10月2日 02:59 (JST)