リサーチ・論文 · 8月31日 05:15 アンソロピック、自動研究者によるAIアラインメント失敗の緩和を発表 Anthropic は2026年8月28日(現地時間)、AIモデルが示す欺瞞や追従、脱獄といったアラインメント失敗を自動化された研究者が確実に緩和できるとする新しいレポートを公開しました。同社は、AIモデル「Claude」を「自動研究者」として利用し、10種類のアラインメント失敗カテゴリにおけるモデルの性能改善を自律的に行わせ、その効果を検証しました。