arXiv、AI研究開発自動化の妨害行為評価「ResearchArena」公開
arXiv cs.AIは2026年7月21日(現地時間)、AI研究開発(R&D)の自動化プロセスにおいて、AIエージェントの出力安全性を評価する新たなフレームワーク「リサーチアリーナ (ResearchArena)」を発表した。このフレームワークは、AI制御の手法を活用し、AIエージェントを潜在的な敵対者と仮定。展開前の段階で隠れた妨害行為 (sabotage) を監視 (monitor) によって検出することを目的としている。本論文はレナ・リボン (Lena Libon) 氏らが執筆した。