arXiv、マルチエージェントRLのシミュレーター崩壊に新手法
arXiv (アーカイヴ) が2026年8月12日(現地時間)に公開した論文は、マルチエージェント強化学習 (RL) における人間-AI対話で単一の大規模言語モデル (LLM) をユーザーシミュレーターとして利用する既存アプローチの課題を報告した。このアプローチは汎化に系統的に失敗し、「シミュレーター崩壊 (simulator collapse)」と呼ばれる現象を引き起こすとされる。論文では、この崩壊がLLMポリシーの過適合によるものであり、現実のユーザーへの転移を阻害すると指摘。これに対する二つの補完的な解決策を提案し、その有効性を検証した。