arXiv cs.AIは2026年9月30日(現地時間)、Max Ku氏らが「World Editing: Intervening on Executable Worlds at Increasing Depth」と題した研究を発表した。インタラクティブな世界モデルにおいて、既存の実行可能な環境を意図的に編集する手法が未開拓であると指摘。本研究は「世界編集」を形式化し、その能力を評価するため、ベンチマーク「IGMBench (アイジーエムベンチ)」とフレームワーク「IGMWorld (アイジーエムワールド)」を導入。最先端のコーディングエージェントは、厳格な基準で78.2%のタスクを解決した。

本研究では、「世界編集」を、既存の環境に介入しつつ、変更すべきでないプロパティを保持することと定義した。また、編集が世界のエンティティ、ダイナミクス、システムをどの程度強く結合するかを示す軸として、介入深度 (intervention depth)という概念を導入した。

これらの能力を検証するため、業界グレードのゲームモッディングを通じてIGMWorld (アイジーエムワールド)を実装し、IGMBench (アイジーエムベンチ)というベンチマークを開発した。IGMBench (アイジーエムベンチ)は、MinecraftとTerrariaの二つのゲームを対象に、110のタスクと1.1K以上の実行可能状態および行動基準を含む。タスクはプロパティ、エンティティ、ダイナミクス、システムへの介入範囲を網羅しており、決定論的実行可能性、行動、保存、視覚的チェックによって評価された。

評価結果によると、最も強力な構成のコーディングエージェントは、厳格なタスクレベル基準において78.2%のタスクを解決し、基準レベルのパフォーマンスでは94.8%に達する。しかし、信頼性は介入深度の増加とともに低下する傾向が見られた。失敗した編集の多くは、依然として正常に構築およびロードされるものの、編集された世界を要求通りに動作させる点に主な困難があることを示唆している。さらに、視覚的一貫性については弱点が残り、評価されたすべての構成で共同視覚合格率は50%を下回った。

これらの結果は、世界編集が世界生成やインタラクションとは異なる独自の能力であり、実行可能なゲームがその研究における実用的なテストベッドを提供することを示している。


参考: arXiv cs.AI — 2026年10月5日 13:00 (JST)

原文ハイライト

"World Editing: Intervening on Executable Worlds at Increasing Depth"

この記事をシェア
X はてブ LinkedIn