Ziyan Jiang(ザイヤン・ジャン)氏らは9月30日(現地時間)、論文『WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents』を論文投稿サイト arXiv(アーカイヴ)のcs.AIカテゴリで公開した。同論文は、インタラクティブな3D(スリーディー)世界における異常検知の評価を目的とした新たなベンチマーク「WorldAuditBench(ワールドオーディットベンチ)」を導入。Unreal Engine 5(アンリアルエンジン5)で構築された13の仮想環境と、213の異常タスクを通じて、マルチモーダルAIシステムの監査能力を検証する。

Ziyan Jiang氏らによる同論文は、仮想空間での知的行動に関する研究が進むにつれ、3Dシミュレーション環境における異常を効率的に特定するパイプライン開発の重要性が増していると指摘する。浮遊オブジェクトや通過可能な壁、シーンと矛盾するオブジェクトなどが異常の具体例として挙げられる。ビジョン言語モデル(VLMs)やビジョン言語アクションモデル(VLAs)を含むマルチモーダルAIシステムは、この種のタスクを自動化する可能性を示しているものの、3D世界監査は複数の要素が絡み合う複雑な課題を伴う。

3D世界の監査には、二つの明確な能力の密接な連携が求められる。一つは、3D世界をナビゲートし、異常を体系的かつ効率的に探索する「アクション」の能力。もう一つは、環境を理解し、マルチモーダルな観察から異常を特定する「視覚的推論」の能力である。これまで、マルチモーダルエージェントがこれらの能力を効果的に連携させ、視覚的推論を用いて潜在的な異常を特定し、アクションを通じてそれを検証できるかについては、十分に検討されていなかった。

WorldAuditBenchでは、固定された探索予算の下で、既存の主要な5つのモデルが評価された。評価は二つの監査パラダイムを用いて実施された。一つはVLAベースの探索後にVLMベースで異常を特定するパラダイム、もう一つは視覚的推論が直接アクション選択を導くエンドツーエンドVLMエージェントのパラダイムである。

その結果、評価対象となったモデルとパラダイム全体で、成功率は6.6%から42.3%の範囲に留まることが示された。これは人間のパフォーマンスである83.4%を大幅に下回る数値である。この評価結果は、マルチモーダルエージェントが探索中に証拠を収集し、それを正確に解釈する能力において、依然として大きな限界を抱えている現状を浮き彫りにしている。


参考: arXiv cs.AI (アーカイブ) — 2026年10月1日 02:55 (JST)

この記事をシェア
X はてブ LinkedIn