OpenAI、長期自律モデルの安全性指針公開 潜在リスクと対策を詳述
OpenAIは7月16日(現地時間)、長期間にわたる自律タスクを実行するモデル(long-horizon models)の安全性とアラインメントに関する知見を公開しました。同社は内部利用中に既存の評価で捕捉できなかった新たな安全性の問題や失敗事例を観測し、アクセスを一時停止。この経験に基づき、新たな評価手法、長期アラインメントの改善、軌跡レベルでの監視強化を実施し、制限付きでのアクセスを再開しました。
Tag
3 件の関連記事
OpenAIは7月16日(現地時間)、長期間にわたる自律タスクを実行するモデル(long-horizon models)の安全性とアラインメントに関する知見を公開しました。同社は内部利用中に既存の評価で捕捉できなかった新たな安全性の問題や失敗事例を観測し、アクセスを一時停止。この経験に基づき、新たな評価手法、長期アラインメントの改善、軌跡レベルでの監視強化を実施し、制限付きでのアクセスを再開しました。
ポッドキャスト「Latent Space」が2026年5月20日(現地時間)付けで報じたところによると、AIインフラ企業Daytonaのイヴァン・ブラジン (Ivan Burazin) CEOは、AIエージェント向けのコンピューティング市場の成長について言及した。同社は月間成長率74%、1日あたり85万回のサンドボックス実行を記録している。ブラジン氏は、エージェントは従来のコード実行環境だけでなく、ステートフルで動的なリソースを持つ「構成可能なコンピューター」を必要としているとの見方を示した。
OpenAIは2026年5月12日(現地時間)、Windows版のコーディングエージェント「Codex」において、安全で効果的なサンドボックス実装を開発したと発表した。これにより、CodexをWindows上で利用する際の非効率なコマンド承認や、完全アクセスモードによるセキュリティリスクといった課題の解決が図られる。同サンドボックスは、Codexがリアルユーザーの権限で動作する潜在的な危険性に対処し、ファイル書き込みやネットワークアクセスに制約を課す。