Ange Tong氏は2026年9月19日(現地時間)、arXiv cs.LG上で公開された論文において、時間依存偏微分方程式 (PDE) の高速近似を可能にするニューラルオペレーターソルバーの精度と効率を向上させる強化学習手法「rollout-verified policy improvement (RV-PI)」を発表した。この手法は、予測誤差が時間と空間で変化する中で、限られた修正予算を最適に配分する「予算制約下適応型ニューラルオペレーターソルビング」問題を解決することを目的としている。

ニューラルオペレーターは時間依存偏微分方程式 (PDE) の高速な代理モデルを提供するが、自己回帰的な展開において、予測誤差の空間的・時間的変動と、経路に沿って実行できる局所的修正の数が限られるという「修正割り当て問題」が発生する。Ange Tong氏らが提案する手法はこれを予算制約下適応型ニューラルオペレーターソルビングとして定式化している。

具体的には、全体の場を進めるグローバルなFourier neural operator、パッチごとの残差修正を提案するlocal operator、どこを修正するかを選択するset-aware selector、そして残りの修正予算をいつ、どの程度使うかを決定するmacro policyの組み合わせで構成される。

rollout-verified policy improvement (RV-PI) は、学習されたPDEソルバーの実際の継続ロールアウトを通じて実行可能な修正回数を評価する。これにより、長期間にわたる利点を保守的な政策目標に変換し、ホールドアウトされた経路誤差が改善した場合にのみ更新を受け入れる。

評価では、浅水ベンチマーク (shallow-water benchmark) における32回の介入予算で、RV-PIは平均経路相対L2誤差0.6910を達成した。これはimmediate-only policy improvementと比較して5.37%の改善、RandomMacroと比較して2.41%の改善に相当する。

また、駆動力のあるBrusselatorベンチマーク (forcing-driven Brusselator benchmark) における76回の介入予算では、RV-PIが0.09954を達成した。これはimmediate-only policy improvementと比較して2.31%の改善、RandomMacroと比較して5.32%の改善を示した。

これらの結果は、固定された修正予算の下では、局所的な修正の価値がその即時的な誤差削減だけでなく、自己回帰経路におけるその後の影響に依存することを示唆している。


参考: arXiv cs.LG — 2026年10月7日 13:00 (JST)

原文ハイライト

"Learning When to Refine: Long-Horizon Reinforcement Learning for Budgeted Neural-Operator PDE Solvers"

この記事をシェア
X はてブ LinkedIn