カリフォルニア大学サンタクルーズ校の研究者らは10月5日(現地時間)、オープンウェイトの大規模言語モデル(LLM)における安全性に関する脆弱性を悪用する、新たなジェイルブレイク手法「Perturbed Embedding Vector (PEV)」を開発したと発表した。この手法は、有害なプロンプトに対するモデルの防御を突破し、安全でない応答を生成できることを実証したという。

Abhinav Sudhakar Dubey氏、Scott Sirri氏、Vaggos Chatziafratis氏、C. Seshadhri氏らは、arXiv cs.CRに発表した研究で、6つの一般的なオープンウェイトLLMにわたる安全性の脆弱性を調査した。研究者らは、JailbreakBenchベンチマークデータセットにおいて、これらのモデルが有害または安全でない応答を一貫して生成することを確認した。

提案されたPerturbed Embedding Vector (PEV)は、既存のジェイルブレイク手法と比較して、より安価でシンプルな技術とされる。従来の多くの手法が勾配計算、プロンプトごとの最適化、またはモデル内部の重み変更を必要とするのに対し、PEVはプロンプトの埋め込みベクトル表現に独立したガウスノイズを追加するだけで機能する。実験の結果、PEVによる最初の攻撃成功までの平均計算コストは、これまでの攻撃よりも最大一桁低いことが観測された。また、新しいプロンプトに対する最初のジェイルブレイクは、テストされたすべてのモデルで通常1分以内に成功し、JailbreakBenchのすべてのプロンプトに対して、すべてのモデルで安全でない応答を生成したという。他のテストされた手法は、実行により時間がかかるにもかかわらず、同等の結果は得られていない。

研究者らは、埋め込みベクトルにおける摂動下でのLLMの挙動を理解することが重要な研究方向であるとの見解を示している。摂動は主要なセキュリティリスクを構成する一方で、モデルの動的挙動を探求するための貴重なツールとしても機能する可能性がある。


参考: arXiv cs.CR (アーカイブ) — 2026年10月7日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn