MoE強化学習のエキスパートルーティング探索、ESRLを提案
ホンイ・ヘ (Hongyi He) 氏らの研究チームは9月11日(現地時間)、オンライン学術誌arXiv cs.CLで公開された論文で、大規模言語モデル (large language models) の後学習で用いられる強化学習 (RL) のMoE (Mixture-of-Experts) モデル向けに、Expert-Space Exploration Reinforcement Learning (ESRL) と呼ばれる新たなフレームワークを提案した。ESRLは、MoEモデルのエキスパートルーティング空間を明示的に探索することで、既存手法が抱える課題に対応する。