ベンダー・製品

OpenAI、長期自律モデルの安全性指針公開 潜在リスクと対策を詳述

OpenAIは7月16日(現地時間)、長期間にわたる自律タスクを実行するモデル(long-horizon models)の安全性とアラインメントに関する知見を公開しました。同社は内部利用中に既存の評価で捕捉できなかった新たな安全性の問題や失敗事例を観測し、アクセスを一時停止。この経験に基づき、新たな評価手法、長期アラインメントの改善、軌跡レベルでの監視強化を実施し、制限付きでのアクセスを再開しました。

リサーチ・論文

大規模言語モデルの安全性向上へ 解釈性手法とツールの初の体系的論文

arxiv.orgは2025年6月5日(現地時間)、大規模言語モデル(LLM)の安全性を向上させる解釈性手法とツールに焦点を当てた初のサーベイ論文を公開した。本論文は、LLMの実用化が進むにつれて不可欠となる、その安全でない挙動の理解と緩和に対し、従来の調査で見過ごされてきた解釈技術と安全性の関連性を統一フレームワークで体系化した。これにより、研究者や実務家がより安全で、解釈可能なLLMの開発を進める上で、重要な指針を提供すると期待される。