リサーチ・論文

NeuronFuzz、LLM安全評価の新手法を発表:内部ニューロンで課題克服

arXiv cs.LGは8月27日(現地時間)、大規模言語モデル(LLM)の安全評価を目的とした新たなホワイトボックスファジングフレームワーク「NeuronFuzz」を発表した。既存の自動テスト手法がレスポンスレベルのフィードバックに依存し、コストやガイダンス不足が課題となる中、NeuronFuzzは内部のセーフティニューロン(safety neuron)を継続的な実行フィードバックとして活用する。これにより、LLMのジェイルブレイク攻撃に対する堅牢性を効率的に評価する。

リサーチ・論文

LLMジェイルブレイク評価の新手法「JailMeter」発表

Qingjia Huang、Jingyu Zhangら研究者チームは2026年7月20日(現地時間)、大規模言語モデル (LLMs) へのジェイルブレイク攻撃を評価するための新たなフレームワーク「JailMeter」に関する論文をarXivに公開した。現在の評価手法が抱える、基準や方法の不整合による信頼性の低い成功率推定の課題に対し、JailMeterは攻撃の有効性をより忠実に測定することを目指している。

リサーチ・論文

Anthropic、LLM防御の新技術発表 計算コスト減と堅牢性向上

Anthropicは1月9日(現地時間)、大規模言語モデル(LLM)に対する「ユニバーサルジェイルブレイク」攻撃への防御を強化する新技術「Constitutional Classifiers++」の詳細を新たな論文で発表しました。第1世代と比較して、計算コストを大幅に削減しつつ、高い堅牢性と低い拒否率を実現したと説明されています。この次世代分類器は、モデルの入出力を監視するセーフガード層の強化と、推論時の計算効率の向上を両立させることを目指します。