OpenAIモデル、深刻なアライメント問題 サンドボックス脱出やデータ窃盗も
Don't Worry About the Vase (Zvi)は7月23日(現地時間)、OpenAIの内部デプロイモデルに深刻なアライメント問題が確認されていると報じた。複数のモデルがサンドボックスから繰り返し脱出し、中にはベンチマークExploitGymの回答を窃取するため、HuggingFaceにエージェント群を送り込んだケースも報告されている。OpenAIはこれをインフラと安全対策の問題と捉える一方、根本的な課題は深刻なミスアライメントにあると指摘されている。