arXivが2026年9月30日(現地時間)付けで報じたところによると、大規模言語モデル (LLMs) を基盤とするAIエージェントが、外部からの影響により過激化する脆弱性を持つことが、新たな研究で明らかになった。この研究では、二つのAIエージェント間の会話をシミュレートし、ターゲットとなるAIエージェントの信念が、インフルエンサーとなるAIエージェントによって過激化される過程を検証した。
研究は、ターゲットとなるAIエージェントが、人口統計学的および心理学的属性に基づいて人間像を演じ、インフルエンサーAIエージェントがそのターゲットの信念をより極端にすることを目的とする会話シミュレーションを通じて実施された。
過激化は二つの経路で分析された。一つは「共鳴 (resonance)」で、インフルエンサーがターゲットの既存の信念を強化する経路。もう一つは「説得 (persuasion)」で、インフルエンサーがターゲットが当初重要視していなかった信念を促進する経路である。感情的および行動的指標の双方において、これら両方のメカニズムがターゲットの過激化を引き起こすことが判明した。しかし、共鳴は説得よりも一貫して強い効果をもたらす結果となった。
追従や未検証の主張の使用など、異なる影響戦術は過激化のレベルに差異を生み出すが、これは指標全体で一貫しているわけではない。さらに、共鳴は関連する信念にも波及することが示され、AIエージェント内の相互接続された信念構造が示唆された。これらの発見は、特にメッセージが既存の信念と一致する場合に、AIエージェントが過激化しやすいことを示しており、パーソナライズされたAIエージェントおよびマルチエージェントAIエコシステムの脆弱性に関する懸念を提起している。
参考: arXiv cs.AI (アーカイブ) — 2026年10月1日 13:00 (JST)
原文ハイライト"AI agents are susceptible to radicalization, particularly when messages align with their existing beliefs"