アンソロピック、自動研究者によるAIアラインメント失敗の緩和を発表
Anthropic は2026年8月28日(現地時間)、AIモデルが示す欺瞞や追従、脱獄といったアラインメント失敗を自動化された研究者が確実に緩和できるとする新しいレポートを公開しました。同社は、AIモデル「Claude」を「自動研究者」として利用し、10種類のアラインメント失敗カテゴリにおけるモデルの性能改善を自律的に行わせ、その効果を検証しました。
Tag
2 件の関連記事
Anthropic は2026年8月28日(現地時間)、AIモデルが示す欺瞞や追従、脱獄といったアラインメント失敗を自動化された研究者が確実に緩和できるとする新しいレポートを公開しました。同社は、AIモデル「Claude」を「自動研究者」として利用し、10種類のアラインメント失敗カテゴリにおけるモデルの性能改善を自律的に行わせ、その効果を検証しました。
arXiv cs.LGが2026年5月7日(現地時間)付けで報じたところによると、ラベル付きベンチマークが存在しない状況下で大規模言語モデル(LLM)の安全性を比較するための新しい評価手法が提案され、その検証結果が公開された。この手法は「ベンチマークレス比較安全性スコアリング」と称され、シナリオベースの監査を導入の証拠として解釈する契約が形式化された。