arXiv cs.AIは10月8日(現地時間)、ラビル・アクチャモフ氏による研究論文『The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate』を発表しました。本研究は、大規模言語モデル(LLM)エージェントが信用審査パイプラインにおいて自己進化する際、その適応を監督者のレビュー可能な範囲に制限し、管理する手法を提案しています。特に、エージェントの改変可能な部分を「ハーネス」と称する実行時設定に限定することで、変更履歴の透明性を確保し、規制遵守を維持しながら安全な自己改善を可能にすることを目指します。

アクチャモフ氏は、自己書き換え能力を持つLLMエージェントが、監督者がレビューすべき変更記録(命名された変更、記録されたテスト、承認)を意図せず破壊してしまう潜在的な課題を指摘しました。この課題に対し、研究は、LLMエージェントの自己進化をランタイムハーネス(命令テキスト、ツール呼び出しロジック、プリミティブ構成要素)のみに限定することを提案しています。

このアプローチでは、モデルの重みを固定し、全ての適応が原因とテストを伴う差分として監督者によるレビューを可能にすることで、変更の透明性と説明責任を確保できると主張しています。

提案された手法は、「デュアルループエンジン」として具体化されており、展開前にハッシュチェーン化された記録を書き込む「アドミッションゲート」を組み込んでいます。このゲートの性能はシミュレーションを通じて測定され、シミュレートされたエージェントとシード付き探索プロポーザが利用されました。

シミュレーションの結果、3つの異なる監督上の再解釈(監督者の指示変更の種類)と3つの深刻度レベル、それぞれ10の異なるシード条件の下で、アドミッションゲートを備えたループは、合計7,449の候補変更のうち144件を承認しました。承認されたこれらの変更は、いずれも保留履歴における既存のエラーを悪化させることはありませんでした。また、低および中程度の深刻度の全てのセルにおいて、見逃しフラグを増加させることなく、偽陽性率を理想的なオラクルレベルまで回復させました。

これに対し、アドミッションゲートを、最近のトレースで可視化されるエラーの少なさに基づく緩やかなチェック(境界のないシステムが適用するチェック)に置き換えた場合、同じループは309件もの有害な変更を承認しました。さらに、90回の実行中49回で、見逃しフラグが10%を超える結果となりました。これは、スクリーニングプロセスが緩くなった結果として偽陽性率が減少したと説明されています。

プリシフトラベルで評価した場合、ゲートは全ての候補を却下したため、再解釈は履歴を再ラベル付けするルールとしてエンコードする必要があることが示唆されました。パラメトリックシフトおよびスコープシフトは局所的に修復可能でしたが、構造的シフトへの対応はプリミティブの置き換えによってのみ可能でした。最も深刻な構造的シフトにおいては、ゲートの固定された許容度が半数のシードで正しい置き換えをブロックするケースも見られました。

本研究で提案されたメカニズムは、EU AI Actのハイリスク信用スコアリング条項に適用可能であるとされています。また、2026年4月の米国モデルリスクガイダンスがエージェントAIをその適用範囲から除外している現状にも言及しています。


参考: arXiv cs.AI — 2026年10月9日 13:00 (JST)

原文ハイライト

"The Harness as the Only Mutable Surface"

この記事をシェア
X はてブ LinkedIn