ループ型言語モデルの安全性課題、深度横断アラインメント手法「SafeBridge」で改善
arXiv (cs.CR) は10月8日(現地時間)、ループ型言語モデル (LoopLMs) における安全性の課題と、これを解決する新たなアラインメント手法「SafeBridge (セーフブリッジ)」に関する研究論文を公開した。論文は、LoopLMsの推論深度が深まるにつれてジェイルブレイク攻撃に対する脆弱性が増加する可能性を指摘。この問題を解決するため、SafeBridgeは共有パラメーターの制御や共同の安全性監視などを通じ、攻撃成功率を大幅に削減すると報告している。同手法は汎用性も向上させつつ、過剰拒否の挙動も抑える。