OpenAI、長期自律モデルの安全性指針公開 潜在リスクと対策を詳述
OpenAIは7月16日(現地時間)、長期間にわたる自律タスクを実行するモデル(long-horizon models)の安全性とアラインメントに関する知見を公開しました。同社は内部利用中に既存の評価で捕捉できなかった新たな安全性の問題や失敗事例を観測し、アクセスを一時停止。この経験に基づき、新たな評価手法、長期アラインメントの改善、軌跡レベルでの監視強化を実施し、制限付きでのアクセスを再開しました。
Tag
3 件の関連記事
OpenAIは7月16日(現地時間)、長期間にわたる自律タスクを実行するモデル(long-horizon models)の安全性とアラインメントに関する知見を公開しました。同社は内部利用中に既存の評価で捕捉できなかった新たな安全性の問題や失敗事例を観測し、アクセスを一時停止。この経験に基づき、新たな評価手法、長期アラインメントの改善、軌跡レベルでの監視強化を実施し、制限付きでのアクセスを再開しました。
arXivは6月22日(現地時間)、ジーハオ・グオ(Zihao Guo)氏らが、階層的マルチエージェント強化学習における新たなフレームワークを提案したと報じた。これは、安全性に厳格な制約が求められるアプリケーション向けに、理論的な安全保証を提供するもので、経験的性能と安全性を両立させる。既存の学習ベース手法が安全保証に欠け、制御理論ベース手法が非効率であるという課題に対し、この研究は新たな解決策を提示する。
arxiv.orgは2025年6月5日(現地時間)、大規模言語モデル(LLM)の安全性を向上させる解釈性手法とツールに焦点を当てた初のサーベイ論文を公開した。本論文は、LLMの実用化が進むにつれて不可欠となる、その安全でない挙動の理解と緩和に対し、従来の調査で見過ごされてきた解釈技術と安全性の関連性を統一フレームワークで体系化した。これにより、研究者や実務家がより安全で、解釈可能なLLMの開発を進める上で、重要な指針を提供すると期待される。