長期エージェント、構造検証でドリフト分離しARC-AGI-3失敗特定
arXiv cs.AIは2026年8月5日(現地時間)、長期にわたるタスクを実行するエージェント(ロングホライズンエージェント)の検証に関する査読前プレプリント論文を公開した。モフセン・アルジャマンディ (Mohsen Arjmandi) 氏が執筆したこの研究は、エージェント自身の自己報告が信頼できない既存の検証手法に対し、事後検証ではない構造的な手法を提案。これにより、ARC-AGI-3におけるタスク完遂がゼロという、本質的な構造的失敗を事前に特定し、ドリフト(乖離)の原因を分離測定可能となる。