リサーチ・論文

MoE強化学習のエキスパートルーティング探索、ESRLを提案

ホンイ・ヘ (Hongyi He) 氏らの研究チームは9月11日(現地時間)、オンライン学術誌arXiv cs.CLで公開された論文で、大規模言語モデル (large language models) の後学習で用いられる強化学習 (RL) のMoE (Mixture-of-Experts) モデル向けに、Expert-Space Exploration Reinforcement Learning (ESRL) と呼ばれる新たなフレームワークを提案した。ESRLは、MoEモデルのエキスパートルーティング空間を明示的に探索することで、既存手法が抱える課題に対応する。

リサーチ・論文

MoEモデル、データ繰り返しで過学習増加 研究論文が指摘

arXiv cs.LGが2026年9月10日(現地時間)付けで公開した論文が、Mixture-of-Experts (MoE) モデルが学習データの繰り返しに対して、高密度活性化Transformerモデルよりも過学習しやすいことを指摘した。人間が作成したテキストデータの供給が枯渇する中、言語モデルの学習データ繰り返しは一般的な手法となっている。この研究は、MoEの性能劣化がデータの繰り返し率に大きく依存し、その影響がスパース性と共に増加することを示している。

リサーチ・論文

クウェン、マルチモーダルMoEモデル「Qwen3.8-Flash-Next」発表

Simon Willison's Weblogは2026年8月26日(現地時間)、クウェン (Qwen) が新たなオープンウェイトモデル「Qwen3.8-Flash-Next」を発表したと報じた。このモデルはマルチモーダルなMoEモデルであり、同時にQwen4で採用されるアーキテクチャの早期プレビューとしての役割を持つ。合計1250億トークン規模ながら、アクティブなトークン数は60億に抑えられており、性能向上を実現している。

リサーチ・論文

MoEモデル量子化ダメージ、経路フリップの検出と修復課題を提示

パーヴェル・グー (Parvel Gu) は7月14日(現地時間)、arXiv cs.AIで論文を公開し、Mixture-of-Experts (MoE) ルーティングの不連続性が、4ビットKVキャッシュの量子化によって引き起こされる「フリップ」現象を明らかにした。このフリップはトークンを決定境界を越えさせ、エキスパートの活性化を反転させる。本研究は新たな緩和策を提案するものではなく、因果関係の解明、経験的発見、および検出限界に関する結果を提供している。

ベンダー・製品

DeepSeek、主力AIモデル「V4 Pro」のプロダクション版をリリース

DeepSeekは8月12日(現地時間)、主力モデル「ディープシーク V4 Pro (DeepSeek V4 Pro)」のプロダクション版をリリースした。約4ヶ月間のプレビュー期間を経て、ビルド「V4 Pro 0813」として一般提供が開始された。OpenRouter (オープンルーター)のモデルページおよびディープシークのAPIドキュメントにて確認できる。API料金は入力トークンが100万あたり$0.435(キャッシュミス時)、出力トークンが100万あたり$0.87で、100万トークンのコンテキストウィンドウに対応する。

リサーチ・論文

オープンモデルの普及加速、新興勢力と中国勢が主要モデルを発表

Interconnectsは2026年8月2日(現地時間)付けで、オープンモデルのエコシステムにおける最新動向を報じた。記事によると、強力なモデルをトレーニングする能力が急速に拡大し、多くの企業が多額の投資を行いながらも、オープンモデルを公開する組織が増加している。特にシンキング・マシーンズ (Thinking Machines) はオープンモデルの微調整サービスで年間数億ドル規模の収益を上げ、米国で最先端のオープンウェイトモデルをリリースしていると指摘した。

リサーチ・論文

PagedWeight、MoE LLM推論のGPUメモリを最大72.0%削減

arXiv cs.LGは7月17日(現地時間)、Mixture-of-Experts (MoE) 大規模言語モデル (LLM) の推論効率を大幅に改善する新手法「PagedWeight」を発表した。同技術は、MoE LLM運用における主要課題である、増大するモデルウェイトとKey-Value (KV) キャッシュのGPUメモリ要件に対し、ランタイムでの動的かつ品質を意識したウェイト量子化で対処する。これにより、エキスパートウェイトの精度を維持しつつKVキャッシュサイズを最適化し、全体的なリソース効率を大幅に改善。特に、既存手法と比較してGPUメモリを最大72.0%削減し、スループットを最大1.94倍向上させることが可能と報告されている。

ベンダー・製品

Tencent、2950億パラメータの「Hy3」をApache 2.0で公開 MoE採用、利用制限撤廃へ

Tencentは7月6日(現地時間)、オープンウェイト言語モデル「Hy3」に関する詳細を公表した。Hy3は2950億パラメータを持つ大規模モデルでありながら、Mixture-of-Experts(MoE)アーキテクチャの採用により、任意のトークン処理にアクティブに稼働するパラメータを約210億に抑えている。地理的および利用制限のないApache 2.0ライセンスでの提供は、オープンモデル市場に新たな選択肢をもたらすと見られる。

ベンダー・製品

Tencent、推論モデル「Hunyuan Hy3」発表 主要製品に統合へ

Tencentは7月7日(現地時間)、Mixture of Experts (MoE) アーキテクチャに基づく新たな推論モデル「Hunyuan Hy3」を発表した。同モデルは総パラメータ数2,950億、アクティブパラメータ数210億を持ち、最大256Kトークンのコンテキストウィンドウに対応。WorkBuddy/CodeBuddy、Yuanbao、Marvis、imaなどの主要製品・サービスにすでに統合されており、Tencent CloudのTokenHubプラットフォームからもAPI提供が開始される。

リサーチ・論文

Mellum 2技術レポート公開、MoE言語モデルでソフトウェア開発に特化

オープンウェイトのMellum 2 (メラム2)は5月29日(現地時間)、その言語モデルに関する技術レポートを公開した。このモデルは120億パラメータのMixture-of-Experts (MoE)モデルであり、トークンあたり25億のアクティブパラメータを持つ。Mellum 2はソフトウェアエンジニアリングに特化した汎用言語モデルとして設計され、コード生成・編集、デバッグ、多段階推論、ツール利用と関数呼び出し、エージェントコーディング、対話型プログラミング支援といった幅広い領域をカバーする。

リサーチ・論文

DECO、Sparse MoEで性能向上 エンドデバイスAIの計算効率改善

arXiv cs.LGは5月11日(現地時間)、Chenyang Song氏らの研究チームが開発した「DECO」を報じた。これはエンドデバイス向けSparse Mixture-of-Experts (MoE) アーキテクチャで、MoEモデルが抱えるストレージやメモリアクセスボトルネックの解消を目指す。DECOは高パフォーマンス、低計算コスト、小さなストレージオーバーヘッドを同時に実現し、限られたリソースのエッジAI環境での高速化に貢献するとされる。報告によると、Dense Transformerと同等の性能を維持しつつ、最大3.00倍の高速化を達成。この技術はAI実用化を加速する上で重要な一歩とみられる。

ベンダー・製品

EMO: 事前学習でモジュール性が創発するMoEモデル発表

Allen Institute for AIは2026年5月8日(現地時間)、人間が定義した事前知識に頼らず、データから直接モジュール構造が創発するよう事前学習された新しい専門家混合 (MoE) モデル「EMO」を公開した。EMOは、特定のタスクにおいて総専門家のわずか12.5%を使用するだけでほぼフルモデルの性能を維持できる。同時に、全専門家を使用する際には強力な汎用モデルとしても機能する。

リサーチ・論文

Zyphra、80億パラメーターMoEモデル「ZAYA1-8B」を発表 推論能力を強化

Zyphraは2026年5月7日(現地時間)、推論に特化した混合エキスパートモデル (MoE)「ZAYA1-8B」の技術レポートを発表した。同モデルは7億のアクティブパラメーターと80億の総パラメーターで構成され、ZyphraのMoE++アーキテクチャを基盤としている。AMDのコンピューティングプラットフォームで訓練され、10億未満のアクティブパラメーターながら、数学やコーディングのベンチマークでDeepSeek-R1-0528を上回る、または同等の性能を示したと報告されている。

リサーチ・論文

MoE向け新アーキテクチャ「UniPool」、グローバル共有エキスパートプール導入

arXiv cs.LGは2026年5月7日(現地時間)、Minbin Huang氏らがMixture-of-Experts (MoE) アーキテクチャの新しい設計「UniPool」を提案したと報じた。UniPoolは、従来層ごとに独立していたエキスパートセットをグローバルな共有プールとして扱い、各層のルーターからアクセスさせる構造を持つ。この設計変更により、LLaMAアーキテクチャの多様なモデルスケールにおいて、既存のMoEと比較して検証損失とパープレキシティの改善が確認された。

リサーチ・論文

EMOがモジュール性高いMoE実現 大規模モデルの選択的専門家利用に道

論文公開サイトarXiv cs.CLが2026年5月7日(現地時間)付けで報じたところによると、大規模言語モデル (Large language models) のモジュール性を高める新しいMixture-of-Experts (MoE) モデル「EMO」が発表された。EMOは、事前学習中に文書の境界のみを用いて、人間の定義する事前知識なしで首尾一貫した専門家グループを形成する。これにより、メモリ制約のある環境での大規模疎モデルの実用性が向上する可能性が示されている。