NeuronFuzz、LLM安全評価の新手法を発表:内部ニューロンで課題克服
arXiv cs.LGは8月27日(現地時間)、大規模言語モデル(LLM)の安全評価を目的とした新たなホワイトボックスファジングフレームワーク「NeuronFuzz」を発表した。既存の自動テスト手法がレスポンスレベルのフィードバックに依存し、コストやガイダンス不足が課題となる中、NeuronFuzzは内部のセーフティニューロン(safety neuron)を継続的な実行フィードバックとして活用する。これにより、LLMのジェイルブレイク攻撃に対する堅牢性を効率的に評価する。