GPT-Red: LLMへの自動レッドチーム化エージェント開発
arXivは2026年7月29日(現地時間)、「GPT-Red: Automated Red Teaming via Self-Play at Scale」と題する論文を発表した。この研究は、フロンティアLLMに対する新たなプロンプトインジェクション攻撃を自動で発見するレッドチーム化エージェント「GPT-Red」を紹介している。同モデルは、プロダクションシステムの堅牢性を評価し改善することを目的とし、GPT-5.6の敵対的訓練に利用されている。