arXiv cs.CRは9月9日(現地時間)、研究論文「Scan the Skill, Govern the Action: Composing Registry Verdicts with Runtime Consequence Control」を公開しました。同論文は、エージェントスキルレジストリにおけるスキル評価の課題と、実行時の結果制御の必要性を報告しています。論文は、オープンクロー (OpenClaw) のセキュリティチームによるスキャナーの重複率の低さに言及しつつ、悪意のあるスキル検出と実行時のアクション許可の判断が別問題であると指摘。クローハブ (ClawHub) の66,192件のスキルバージョンに対する測定結果を示しています。

ロヒット・タネジャ (Rohit Taneja) 氏とトラビス・ウェーバー (Travis Weber) 氏らが発表したこの論文は、エージェントスキルレジストリが公開するスキルを選別する際の一般的なアプローチに疑問を呈しています。オープンクロー (OpenClaw) のセキュリティチームの報告では、スキャナーが重複して陽性と判断するケースは最大10.4%に過ぎず、フラグ付けされたスキルの81.9%は単一のスキャナーによってのみ検出されたとされています。

研究者らは、問題はどのスキャナーが正しいかではなく、何が問われているかにあると主張しました。各スキャナーは「このスキルは悪意があるか?」という問いに答えるように設計されていますが、このアクションは現在、このオペレーターによってここで許可されているか?という問いを表現するようには設計されていません。

研究では、66,192件のクローハブ (ClawHub) スキルバージョンに対して3つの測定が行われました。まず、135の異なる発行元にわたる705のスキルが、すべてのスキャナーとレジストリの評価者によってクリーンと評価されたにもかかわらず、CIS Control 2.7およびNIST SP 800-53 CM-11によって禁止されるアクションを指示していることが判明しました。100件の手動監査では、検出器の精度は92%であり、悪意のある意図の兆候は見られませんでした。この705件のうち506件は単一の発行元によるものでした。

第二に、ライブエージェントがサンドボックス内で実際のスキル文書に従って実行した144のコマンドのうち、34.7%がその文書には記載されていない結果クラスを伴っていました。第三に、クリーンな記録が確認できないアクションを記述している53のクリアされたスキルについて、エージェントが23件のアクションを実行しようとした際、そのすべてがゲートによって阻止されたと報告しています。

研究チームは、このギャップに対する設計として、意思決定パスにモデルを含まない決定論的リゾルバを提案しています。このリゾルバは、オペレーターの表明されたリスク許容度から導かれる昇格しきい値を持つ、リソースとクラスごとのトラストレジャーに情報を供給します。研究で使用されたハーネスおよび記録されたすべてのコマンドは公開されています。


参考: arXiv cs.CR — 2026年9月14日 13:00 (JST)

原文ハイライト

"Scan the Skill, Govern the Action: Composing Registry Verdicts with Runtime Consequence Control"

この記事をシェア
X はてブ LinkedIn