arXivは2026年5月6日(現地時間)付けで、Tejasvi C. Addagada氏による論文「Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B」を公開した。同論文によると、Semalith v1.4は1億8400万(184M)パラメータの安全性分類器であり、大規模言語モデル (LLM) のプロンプトインジェクション検出において、Llama-Guard-3-8Bと比較して44分の1のパラメータ数で最先端の性能を達成したとされる。

Semalith v1.4は、DeBERTa-v3-baseを基盤とする分類器で、単一の順伝播でプロンプトインジェクション(LLMに対する指示乗っ取り攻撃)、一般的な有害性、金融サービス規制コンプライアンスを同時に分類する。

このモデルは、無害(BENIGN)、9種類のプロンプトインジェクションサブタイプ、一般的な有害性、11種類のBFSI(銀行・金融サービス・保険)ラベルを含む22クラスのヘッドを持ち、4クラスの補助スーパーカテゴリヘッドと共に結合重み付け損失の下で学習された。学習には、49の公開ソースから採掘され、SHA-1重複排除された76,204行のコーパスが使用され、22のベンチマーク中21でゼロ汚染(最大0.22%)が確認されている。

Llama-Guard-3-8Bとの比較評価では、22のホールドアウトベンチマークにおいて、Semalith v1.4はプロンプトインジェクションの7つの評価すべてで優位に立ち、全体で18のベンチマーク中11で勝利した。また、208の無害なエージェント的プロンプトに対する偽陽性率 (FPR) は0.000であり、Llama-Guard-3-8Bの0.063と比較して低性能を示している。一般的な有害性ベンチマーク(WildGuardMix, HEx-PHI, HarmBench)ではLlama-Guard-3が優位だが、これは補完的な分割であると論文のセクション4で文書化されている。さらに、6つの測定された弱点がセクション6で開示されている。

展開ガイドラインとして、Semalith v1.3は対話型モデレーション展開(ToxicChat F1スコア0.624)に推奨され、Semalith v1.4はBFSIラベルのカバレッジまたは無害なエージェント的プロンプトに対するゼロFPRが優先される場合に推奨されると記載されている。この論文は16ページ、8つの表を含み、図は含まれていない。


参考: arXiv cs.LG (アーカイブ) — 2026年7月29日 13:00 (JST)

原文ハイライト

"A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters"

この記事をシェア
X はてブ LinkedIn