arXiv cs.LGは9月24日(現地時間)、Srini Ramaswamy氏らが執筆した論文「Bounded Autonomy and Verifiable Safety for Agentic AI Enabled Automation」を公開した。論文では、危険度の高い環境でAgentic AI (エージェンティックAI) が関わる自動化システムを安全に展開するための新しいフレームワーク「BRaVeS (ブレイブス)」が提案されている。確率的推論にのみ依存する既存システムは、推論が深まるにつれて専門家の安全運用制約から逸脱する「epistemic drift」のリスクを抱えていることが指摘されている。

BRaVeSは、Defensible Next-Gen Reasoning System (DNRS)とも呼ばれ、境界付き推論と安全ガバナンスのためのフレームワークである。このフレームワークは、専門家によって定義された制約をinvariant anchorsとして符号化する。推論中にこれらのアンカーを可視化するメカニズムとして、MoDA-Style (Mixture of Depths Attention)を用いた深度認識型アクセスを提案している。さらに、「SMARtAutonomy」と呼ばれる状態階層を利用し、epistemic riskが増加するにつれてシステムの自律性を低減させる仕組みを導入した。

境界付き回復を形式化するため、研究チームはLyapunov-Bounded Consensus Framework (LBCF)を導入した。LBCFは、連続的なepistemic-risk信号を有限のK-bag抽象化にマッピングする。これにより、Lyapunov-style energy descentを強制するシールド付き状態遷移を適用するか、システムを人間が介在する終端状態へルーティングする。この形式的な収束結果は、固定された閾値と実現可能なシールドの仮定の下での有限LBCF抽象化に適用されるものであり、完全な連続ニューラル活性化空間の安全性を証明するものではないとされている。

フレームワークの評価は、離散イベントモンテカルロシミュレーションを通じて実施された。このシミュレーションでは、HAI 22.04 industrial-control-system time-series dataが合成ノイズとセンサー劣化体制とともに使用された。テストされたパラメータグルーピング戦略と閾値において、LBCFプロセスは有限ステップ収束を達成し、安全ガード違反は発生しなかった。これらの結果は、指定された抽象化の下で境界付きガバナンス動作が強制可能であることをシミュレーションベースの証拠として提供する。また、将来のトランスフォーマー実装、ライブでのヒューマン・イン・ザ・ループ検証、およびより広範な敵対的設定に関する研究を推進する可能性がある。


参考: arXiv cs.LG — 2026年10月8日 13:00 (JST)

原文ハイライト

"Bounded Autonomy and Verifiable Safety for Agentic AI Enabled Automation"

この記事をシェア
X はてブ LinkedIn