OpenAI、自己学習型レッドチーム「GPT-Red」発表 プロンプトインジェクション耐性を強化
OpenAIは7月8日(現地時間)、大規模言語モデル(LLM)の安全性と堅牢性を向上させるための自動化された自己学習型レッドチームモデル「GPT-Red(ジーピーティー・レッド)」を発表した。同モデルは、特にプロンプトインジェクションに対する耐性を強化することを目的としており、従来の人間によるレッドチームが抱えるスケーラビリティの課題を解決し、モデル展開前の脆弱性特定能力を大幅に高めるとしている。
Tag
4 件の関連記事
OpenAIは7月8日(現地時間)、大規模言語モデル(LLM)の安全性と堅牢性を向上させるための自動化された自己学習型レッドチームモデル「GPT-Red(ジーピーティー・レッド)」を発表した。同モデルは、特にプロンプトインジェクションに対する耐性を強化することを目的としており、従来の人間によるレッドチームが抱えるスケーラビリティの課題を解決し、モデル展開前の脆弱性特定能力を大幅に高めるとしている。
Latent Spaceは2026年6月22日(現地時間)、ポッドキャストを公開し、その中でOpenAIのボードメンバーであるZico KolterとGray SwanのCEOであるMatt Fredriksonが、AIセキュリティの特性について解説した。両氏は、プロンプトインジェクションやAIエージェントが導入する新しい脆弱性クラスに焦点を当て、Gray Swanの取り組みと関連ツールについて言及。従来のサイバーセキュリティとは異なるAI固有のリスクと対策の必要性を強調した。
arXiv cs.CRは2026年6月12日(現地時間)、エージェント型大規模言語モデル (LLM) システム「オープンクロー (OpenClaw)」のセキュリティ脆弱性に関する分析論文を公開した。この論文は、複数のエージェントが連携して動作するシステムにおいて、攻撃対象領域が拡大し、単一エージェントの場合と比較して侵害確率が大幅に上昇する可能性を指摘している。さらに、プロンプトインジェクションがシステム全体に不安定性を伝播させる状況も報告されており、エージェント型システムの潜在的リスクに警鐘を鳴らした。
OpenAIは2026年2月13日(現地時間)、対話型AIサービスChatGPTに「Lockdown Mode」と「Elevated Risk」ラベルの二つの新機能を導入したと発表した。これらの機能は、AIシステムが複雑なタスクや、ウェブおよび接続アプリを伴うタスクを処理する際のセキュリティリスク、特にプロンプトインジェクション攻撃への対策を強化することを目的としている。「Lockdown Mode」は機密性の高い利用者向けの高度なセキュリティ設定であり、「Elevated Risk」ラベルは特定の機能に伴うリスクを視覚的に通知する。