Pengfei Li氏らは10月1日(現地時間)、学術論文公開サイトarXiv cs.CLで公開された論文にて、大規模言語モデル (LLM) 向けの新たなベンチマーク「カリベンチ (KaliBench)」を発表しました。同ベンチマークは、サイバーセキュリティの著名なOSであるKali Linux上で、自然言語による指示からコマンドラインインターフェース (CLI) コマンドへの変換能力を詳細に評価するものです。既存の評価手法が知識ベースの評価やエンドツーエンドのタスクに留まり、実行可能なCLIコマンド生成能力を直接測定していない点を指摘し、このギャップを埋めることを目指しています。

カリベンチ (KaliBench) は、合計8,504のクエリとコマンドのペア、そして1,642種のセキュリティツールを含んでおり、23の機能次元と5つのサイバーセキュリティフェーズにわたる広範な評価を可能にします。このベンチマークは、決定論的な正規化とエイリアス対応評価を特徴とする、独自に開発された原稿に基づくパイプラインを通じて構築されました。これにより、LLMが適切なツールを選択し、正確な引数を構築する能力を、再現性の高い形で評価することが可能となっています。

意味論的な正確性と実際の実行可能性を確保するため、開発チームは多段階の検証パイプラインを構築しました。これには、LLMを用いた検証、サンドボックス化された環境でのターミナル実行、そして人間による手作業での改善が組み合わされています。さらに、モデルのトレーニングを効率化するために、実行時コストが発生せず、かつ検証可能な報酬システムも提供されます。この報酬システムは、モデルが生成したコマンドの品質を客観的に評価し、学習プロセスにフィードバックするための重要な要素となります。

汎用モデルおよびセキュリティに特化したモデルを含む、24種類の異なる設定を持つオープンウェイトモデルを用いた評価が実施されました。その結果、明示的なツールヒントなしの無制限設定においては、どのモデルも正確なコマンド生成精度で42%を超えることはありませんでした。この結果は、CLIベースのサイバーセキュリティツールを、明示的な支援なしで正確に活用することの困難さを明確に示しています。

しかしながら、カリベンチから得られる検証可能な報酬を活用した教師ありファインチューニングや強化学習を適用した結果、8B (80億) パラメータを持つモデルの性能は大幅に向上したと報告されています。具体的には、この8Bモデルは、685B (6,850億) パラメータを持つMixture-of-Experts (MoE) モデルに匹敵するパフォーマンスを達成しました。この成果は、ベンチマークが提供する高品質なデータと報酬システムが、LLMのサイバーセキュリティタスクにおける実用的な能力向上に大きく貢献することを示唆しています。本論文は、人工知能分野のトップカンファレンスである神経情報処理システムに関する会議 (NeurIPS) の2026年評価とデータセットトラックで採択されています。


参考: arXiv cs.CL (アーカイブ) — 2026年10月2日 02:59 (JST)

原文ハイライト

"KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards"

この記事をシェア
X はてブ LinkedIn