arXiv (cs.CR) は10月8日(現地時間)、ループ型言語モデル (LoopLMs) における安全性の課題と、これを解決する新たなアラインメント手法「SafeBridge (セーフブリッジ)」に関する研究論文を公開した。論文は、LoopLMsの推論深度が深まるにつれてジェイルブレイク攻撃に対する脆弱性が増加する可能性を指摘。この問題を解決するため、SafeBridgeは共有パラメーターの制御や共同の安全性監視などを通じ、攻撃成功率を大幅に削減すると報告している。同手法は汎用性も向上させつつ、過剰拒否の挙動も抑える。
イー・ワン (Yi Wang) 氏らの研究チームが発表した論文によると、LoopLMsは共有パラメーターを反復的に使用することで、モデルの能力を効率的に拡張できる。しかし、各反復深度から独立した出力を読み出すことが可能であるため、単一のLoopLMが広範な出力空間を露呈し、反復計算全体で安全性が維持されるかという重要な問題が提起されていた。
従来の評価では、より深い反復が有害なクエリに対する安全性を向上させる可能性が示唆されていたものの、ジェイルブレイク攻撃下での堅牢性については不明瞭だった。研究チームは、異なる反復深度を標的としたジェイルブレイク攻撃下でLoopLMsの包括的な安全性評価を実施。その結果、深い推論深度で攻撃成功率が増加する可能性があり、同じクエリでも深度によって異なる安全性の挙動を引き起こすこと、そしてある深度に対して構築された攻撃が他の深度にも転移することが判明した。さらに、Supervised Fine-Tuning (SFT) や選好アラインメント (preference alignment) といった既存の手法では、これらの安全性のギャップは解消されないと報告されている。
これらの課題に対処するため、研究チームはLoopLMs専用のアラインメント手法としてSafeBridgeを導入した。SafeBridgeは、共有される反復層の軽量な深度固有制御、選択的状態ブリッジング、および反復深度全体にわたる共同の安全性監視を組み合わせた手法である。この手法は、複数のモデル規模、複数の攻撃方法、複数の安全性ベンチマークにおいて、整合深度攻撃 (matched-depth attacks) および交差深度攻撃 (cross-depth attacks) の両方で攻撃成功率を大幅に削減することに成功した。
SafeBridgeはまた、バニラモデルと比較して一般的な有用性を向上させつつ、同等の過剰拒否挙動を維持している。この結果は、LoopLMの安全性を単一の反復深度から推測することはできず、反復計算全体での安全性アラインメントが必要であることを示唆している。
参考: arXiv cs.CR — 2026年10月9日 13:00 (JST)