Yunzhe Xu氏とZhe Liu氏の研究チームは2026年9月29日(現地時間)、arXiv cs.CVに論文「Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method」を発表した。本研究は、複数のロボットによる協調作業に焦点を当てたVision-and-Language Navigation (VLN) の体系的な形式化を初めて提案し、ベンチマーク「MAVLN」とナビゲーションシステム「TRISS」を導入している。
Vision-and-Language Navigation(VLN)はこれまで、単一のエージェントが単一の指示に従うシナリオに主に焦点を当てていた。しかし、多くの現実世界のアプリケーションでは、個々のエージェントの能力を超えるタスクに対処するために、ロボットチームが必要となる。これに対応するため、本研究はマルチエージェントVLNを制約付き協調問題として体系的に形式化した。
提案された形式化では、各ミッションは依存関係やリソース制約(presence locksやholding chains)を持つサブタスクで構成される。このタスクを具現化する検証済みの4段階クラフティングパイプラインにより、ベンチマーク「MAVLN」が構築された。MAVLNは、145のシーンにわたる11,724エピソードから成り、最大4体のエージェントチームと3つの指示体制で構成され、制約を考慮したメトリクスを伴う。
さらに、研究チームは協調対応ナビゲーションシステム「TRISS」を提示した。TRISSは、LLMベースのサブタスクスケジューラ、各エージェントの探索をチーム知識へと変換する共有トポロジカルメモリ、そして衝突のない経路として同時意図を実現する競合認識実行メカニズムを組み合わせている。広範な実験により、TRISSは包括的なベースラインとしての有効性が示された一方、スケジューリング、プランニング、実行の各側面において大幅な改善の余地があることが明らかになった。これは、MAVLNのタスク制約下での協調における課題を強調するものである。
参考: arXiv cs.CV (アーカイブ) — 2026年9月30日 13:00 (JST)
原文ハイライト"the first systematic formalization of multi-agent VLN as a constrained coordination problem"