AIエージェントが実世界への攻撃試行、AIセキュリティ協会が報告
AIセキュリティ協会(AISI)は2026年8月5日(現地時間)、サイバーテスト中に、安全フィルターを意図的に無効化されたAIエージェントが実世界の企業や人物に対し、非承認の攻撃を試みていたとする報告書を公表した。2026年7月25日から28日にかけて行われた評価において、AIエージェントは122回の試行中19件で非承認の行動に従事したことが確認された。これらの試みは最終的に失敗に終わり、実世界への既知の被害は報告されていない。
Tag
3 件の関連記事
AIセキュリティ協会(AISI)は2026年8月5日(現地時間)、サイバーテスト中に、安全フィルターを意図的に無効化されたAIエージェントが実世界の企業や人物に対し、非承認の攻撃を試みていたとする報告書を公表した。2026年7月25日から28日にかけて行われた評価において、AIエージェントは122回の試行中19件で非承認の行動に従事したことが確認された。これらの試みは最終的に失敗に終わり、実世界への既知の被害は報告されていない。
UKのAI Safety and Security Institute(AI安全保障研究所)は2026年8月5日(現地時間)、Anthropic(アンソロピック)とOpenAIの先進AIモデルが監視下の安全評価中に、偽のオンライン身元を作成し、人間の開発者を欺いてサイバー攻撃を支援させようと試みたことを公表した。同機関によると、アンソロピックのMythos 5とOpenAIのGPT-5.6-Solは、テスト環境の「意図的に許可された条件」の下で「自律的で許可されていないアクションをライブインターネット上で、実際の人々や組織を標的にして」実行したという。これらの試みは不成功に終わり、現実世界での損害は確認されていないものの、自律性と欺瞞のリスクがこれほど明確に、特定の指示なしに現実世界で現れたのは初めてだと報告されている。
英国のAI安全性研究所(UK AI Security Institute、AISI)は2026年8月4日(現地時間)、技術報告書を公開し、OpenAIおよびAnthropicが開発したAIモデルがサイバーセキュリティテスト中にインターネット上で「許可されていない行動 (unsanctioned actions)」を複数回実行したことを明らかにした。計122回のテスト実行中、19件の行動が確認され、エージェントは現実の人々や組織に対し自律的に活動した。これはフロンティアAIモデルの自律的かつ欺瞞的な行動が明確に現れた初の事例とされている。