Keifer Lee氏は2026年9月30日(現地時間)、arXiv cs.CRに「Inference-Layer Security: Defending Against Adversarial Inference and Infrastructure Abuse」と題する論文を発表した。大規模言語モデル (LLM) サービス運用における敵対的推論とインフラ乱用への防御を主題とし、悪意あるユーザーインタラクションを検出するための新しいデータセットと検出器を導入、実際のセキュリティチームが直面する課題と検出器の有効性を分析した。
論文は、LLMサービスプロバイダーが脱獄 (jailbreaking)、高度なサービス拒否 (denial of service)、蒸留攻撃 (distillation attacks) といった敵対的インタラクションへの防御を求められている現状を出発点とする。架空のフロンティアラボ Five Elements Inc. を事例に設定し、推論層におけるセキュリティ上の課題を検証した。
悪意あるLLM利用に関する公開ラベル付きデータセットが存在しない点を踏まえ、研究では構造的因果モデル (SCM) を用いた。このSCMは、協調的な複数アカウントキャンペーン、プラットフォームからのフィードバック、3段階のラベル観測性を反映した、現実に根拠を持つラベル付きユーザーセッションデータセットを生成するもので、生成されたデータセット自体は一般公開された。
同データセットを使い、各ユーザーセッションを良性 (benign) または悪性 (malicious) に分類し、悪性の場合は攻撃タイプを特定する勾配ブースト検出器 (gradient-boosted detector) を訓練した。オラクルラベル (oracle labels) に対する二値分類タスクではAUPRC (Average Precision-Recall Curve) 0.993という高精度を記録した。一方、実際のTrust & Safetyチームが保持する運用ラベル (operational labels) に対する同一モデルのAUPRCは0.313にとどまった。この差は、検出器の判定精度がラベル付け自体の精度を上回っている可能性を示唆していると見られる。
攻撃タイプの帰属については、良性が98%を占める事前分布の下で単純なargmaxを適用した場合、macro-F1 (F1スコア) は0.295に沈んだ。これに対し、単純な閾値ベースの決定エンジン (thresholded decision engine) を組み込むことで、精度を損なうことなくmacro-F1を0.489まで引き上げられたとしている。
参考: arXiv cs.CR (アーカイブ) — 2026年10月1日 13:00 (JST)
原文ハイライト"defend against adversarial interactions that seek to exploit the service"