LLMのサイバーセキュリティCLI評価「カリベンチ」発表
Pengfei Li氏らは10月1日(現地時間)、学術論文公開サイトarXiv cs.CLで公開された論文にて、大規模言語モデル (LLM) 向けの新たなベンチマーク「カリベンチ (KaliBench)」を発表しました。同ベンチマークは、サイバーセキュリティの著名なOSであるKali Linux上で、自然言語による指示からコマンドラインインターフェース (CLI) コマンドへの変換能力を詳細に評価するものです。既存の評価手法が知識ベースの評価やエンドツーエンドのタスクに留まり、実行可能なCLIコマンド生成能力を直接測定していない点を指摘し、このギャップを埋めることを目指しています。