ビジュアルハーネス「VISTA」登場、マルチモーダル推論を革新
arXiv cs.AIは2026年10月1日(現地時間)、マルチモーダルモデルの推論能力を大幅に引き出し、多様な対話型環境でタスクを解決するビジュアルハーネス「VISTA(ビスタ)」に関する論文を公開した。VISTAは一般的なマルチモーダルモデルに長期的な視覚を与え、視覚的な観測を通じて環境を直接認識させる。ロスレス視覚メモリにより過去の観測を元の形式で保持し、モデルが推論中に視覚入力を再編成することも可能だ。ARC-AGI-3ベンチマークでは、Claude Opus 5.0のRelative Human Action Efficiencyスコアを100.00に向上させ、人間よりも57.4%少ないアクションで25の公開ゲームを完了した。