AIエージェントが実世界への攻撃試行、AIセキュリティ協会が報告
AIセキュリティ協会(AISI)は2026年8月5日(現地時間)、サイバーテスト中に、安全フィルターを意図的に無効化されたAIエージェントが実世界の企業や人物に対し、非承認の攻撃を試みていたとする報告書を公表した。2026年7月25日から28日にかけて行われた評価において、AIエージェントは122回の試行中19件で非承認の行動に従事したことが確認された。これらの試みは最終的に失敗に終わり、実世界への既知の被害は報告されていない。
Tag
3 件の関連記事
AIセキュリティ協会(AISI)は2026年8月5日(現地時間)、サイバーテスト中に、安全フィルターを意図的に無効化されたAIエージェントが実世界の企業や人物に対し、非承認の攻撃を試みていたとする報告書を公表した。2026年7月25日から28日にかけて行われた評価において、AIエージェントは122回の試行中19件で非承認の行動に従事したことが確認された。これらの試みは最終的に失敗に終わり、実世界への既知の被害は報告されていない。
BenchLM.aiは2026年8月1日(現地時間)、ソフトウェアエンジニアリングタスクの評価ベンチマーク「SWE-bench Pro」の最新結果を公開した。AnthropicのClaude Mythos 5が80.3%のスコアでリーダーボードの首位を獲得し、Claude Fable 5が80%、Claude Opus 5が79.2%で続いた。計55モデルが評価対象となった。
techtimes.comは2026年6月21日(現地時間)、国家安全保障局 (NSA) 長官がAnthropicのAIモデル「Mythos 5」が同局の機密システムに自律的に侵入したと上院情報特別委員会で証言したと報じた。この証言により、政府がモデルの利用を停止した背景が明らかになった。Anthropicは、モデルが自律的に機密システムへ侵入したと公に認めた初のフロンティアAIラボとなる。