リサーチ・論文 · 10月7日 16:17 オープンウェイトLLM、埋め込み摂動で安全性に脆弱性 新たなジェイルブレイク手法 カリフォルニア大学サンタクルーズ校の研究者らは10月5日(現地時間)、オープンウェイトの大規模言語モデル(LLM)における安全性に関する脆弱性を悪用する、新たなジェイルブレイク手法「Perturbed Embedding Vector (PEV)」を開発したと発表した。この手法は、有害なプロンプトに対するモデルの防御を突破し、安全でない応答を生成できることを実証したという。