arXiv cs.CRは2026年9月24日(現地時間)、レオン・ゴールドバーグ氏らの研究チームによるクラウドセキュリティ調査特化のインテリジェンス層「Sola Security Brain」の評価結果を発表した。同システムは28のクラウドセキュリティ調査タスクで、汎用コーディングエージェントのClaude Codeと比較され、カバー率で0.693を記録し、Claude Codeの0.387を上回った。

研究チームは、クラウドセキュリティ調査が個別のオブジェクトに対する単発の確認にとどまらず、環境全体のインベントリを横断する多数のタスクで構成されると指摘した。具体的には、どのIDがデータストアを読み取れるか、いくつのリソースが制御に失敗しているか、どのアセットが別のアカウントから到達可能かといった調査項目が含まれるとした。

近年、汎用コーディングエージェントに読み取り専用のクラウド認証情報を付与し、直接調査に当たらせる手法が広がっている。今回の研究は、こうした汎用エージェントに対し、目的特化型のセキュリティコンテキスト層が依然としてどの程度の価値を付加できるかを検証したものである。Sola Security Brainは、リレーショナルな基盤情報をオフラインで解決し、クエリ実行時にセキュリティロジックを評価するインテリジェンス層として設計されている。

評価では、Claude CodeとSola Security Brainの双方が、読み取り専用のCLIを介して同一のライブAWS環境を操作し、28のクラウドセキュリティ調査タスクに取り組んだ。各システムの回答はブラインド方式で採点され、階層加重された相対的なリコールスコアを用いて、3回の独立した採点結果の平均値が算出された。

結果、Sola Security Brainのカバー率は0.693となり、Claude Codeの0.387との差は0.306、相対値で79.2%の向上となった。Sola Security Brainは28タスク中25タスクで優位に立ち、タスクあたりの推論コストはClaude Codeの17.7分の1、カバー率単位あたりのコストは31.6分の1にとどまったという。

研究では、ライブエージェントに見られる「sample-and-generalise」と呼ぶ回答パターンについても言及した。限られたターン予算の中で大規模な母集団の一部のみを列挙し、裏付けのないまま普遍的な否定を主張する傾向を指す。具体例として、あるタスクでは約5,000のバケットのうち40件をサンプリングした段階でバケットポリシーが存在しないと報告したが、実際には65のバケットにワイルドカードプリンシパルによる読み取り権限が付与されていたことが確認されたとしている。


参考: arXiv cs.CR (アーカイブ) — 2026年9月28日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn