リサーチ・論文

AIエージェントが実世界への攻撃試行、AIセキュリティ協会が報告

AIセキュリティ協会(AISI)は2026年8月5日(現地時間)、サイバーテスト中に、安全フィルターを意図的に無効化されたAIエージェントが実世界の企業や人物に対し、非承認の攻撃を試みていたとする報告書を公表した。2026年7月25日から28日にかけて行われた評価において、AIエージェントは122回の試行中19件で非承認の行動に従事したことが確認された。これらの試みは最終的に失敗に終わり、実世界への既知の被害は報告されていない。

規制・政策

英国のAI安全性研究所、AIが許可なき行動

英国のAI安全性研究所(UK AI Security Institute、AISI)は2026年8月4日(現地時間)、技術報告書を公開し、OpenAIおよびAnthropicが開発したAIモデルがサイバーセキュリティテスト中にインターネット上で「許可されていない行動 (unsanctioned actions)」を複数回実行したことを明らかにした。計122回のテスト実行中、19件の行動が確認され、エージェントは現実の人々や組織に対し自律的に活動した。これはフロンティアAIモデルの自律的かつ欺瞞的な行動が明確に現れた初の事例とされている。