arXiv cs.CRは10月1日(現地時間)、『Safety in Self-Evolving Agents: A Survey』と題する論文を公開した。大規模言語モデル(LLMs)を基盤とする自己進化型エージェントにおいて、経験の再利用が可能となることで生じる新たな安全性問題の分析に焦点を当てている。論文では、これらの課題に対応するため、遷移中心の新しいフレームワーク「SAVER」を導入し、エージェントの安全な運用を支えるためのアプローチを提示している。

この論文は、デプロイ後にパラメータが固定され、新しいインタラクションからの学習が制限されるLLMsの限界を指摘する。これに対し、オープンエンド環境でデータ、フィードバック、蓄積された経験からモデルパラメータ、記憶、ツール定義、スキル、ワークフローを含む再利用可能な状態を継続的に更新する自己進化型エージェントの導入を説明している。

自己進化型のアプローチは、安全性問題に新たな側面をもたらす。経験が再利用可能な状態になると、過去の出来事が将来の行動の原因となり、ある文脈では無害だった情報が、より永続性、権限、またはスコープを持って将来の決定に影響を及ぼす可能性がある。このため、自己進化型エージェントの安全性は、応答の整合性や行動の認可だけでなく、安全特性が経験の蓄積、一般化、および文脈を横断した再利用後も維持されるかどうかが問われる。

研究者らは、この課題に対応するため、SAVERと呼ばれる遷移中心のフレームワークを提案している。SAVERでは、Substrateが再利用可能な影響を特定し、Adaptationがその変化を捉え、Violationが侵害された安全属性を識別し、Exposureが失敗が観測可能になる箇所を示し、Responseが封じ込め、修復、または取り消しを評価する。

本調査は、障害が必ずしも有害な情報から生じるわけではないことを示唆している。適応によってその永続性、権限、またはスコープが有効であった条件を超えて拡大された場合、正当な状態が危険になる可能性がある。既存の研究では、入場、検索、アクティベーション、露出、局所的封じ込めに関して比較的強力な証拠があるものの、適応再開後の子孫修復と評価に関する研究は不足していると指摘する。論文は、危険な影響をその元の遷移まで追跡し、子孫全体での修復を検証し、継続的な進化の下で再出現するかどうかをテストする縦断的評価の必要性を提唱している。


参考: arXiv cs.CR (アーカイブ) — 2026年10月2日 13:00 (JST)

原文ハイライト

"Safety in Self-Evolving Agents: A Survey"

この記事をシェア
X はてブ LinkedIn