Qisong Guo氏ら研究チームは2026年6月4日(現地時間)、自律走行における安全なオフライン強化学習(RL)のためのリスク認識型階層的拡散フレームワーク「DiDrive」を発表した。この新手法は、拡散モデルが多峰性の行動事前分布を捉える一方で、オフラインRLポリシーが抱える分布シフトや、データ範囲外の行動生成(OOD行動生成)といった課題に対処することを目指す。
DiDriveは、二つの相乗効果的なコンポーネントであるリスク認識型階層的拡散(RHDif)アーキテクチャと「3DICE政策最適化パラダイム」を特徴とする。
状態空間においては、RHDifアーキテクチャが機能する。これは、低レベルのリスクゲートエンコーダと高レベルの文脈モジュレータを組み合わせて活用することで、環境に存在する冗長な情報をフィルタリングし、自律走行にとって安全上極めて重要となる脅威に焦点を絞る。これにより、システムは膨大な情報の中から、実際にリスクを伴う要素を効率的に識別し、意思決定の精度を高めることが可能となる。
一方、行動空間においては、3DICE政策最適化パラダイムが主要な役割を果たす。このパラダイムは、インサンプルで較正されたガイダンス、時空間最適化、およびアンサンブルベースの候補ランキングという三つのアプローチを組み合わせることで、OOD行動生成に伴う過大評価や勾配振動といった問題を緩和する。従来のオフラインRLでは、訓練データの範囲外の行動が不適切に評価され、ポリシーの信頼性が損なわれることが課題であったが、3DICEはこれを抑制し、より堅牢な行動生成を促す。
研究チームは、DiDriveの有効性を評価するため、一般的な自律走行シミュレーションベンチマークであるCARLAを活用した。実験では、DiDriveがIQL、CQL、Diffusion-QLといった既存の最先端ベースライン手法と比較して優れた性能を示すことが実証された。特に、60台の車両が存在する複雑かつ高密度な交通シナリオにおいて、DiDriveは85%という高い成功率と、4295.68という平均報酬を達成した。これは、既存手法を大きく上回る成果であり、DiDriveが実世界の多様な状況下での安全な自律走行意思決定に対し、堅牢かつ信頼性の高い経路を提供しうる可能性を示唆している。
参考: arXiv cs.LG — 2026年9月3日 13:00 (JST)