MoEモデル、データ繰り返しで過学習増加 研究論文が指摘
arXiv cs.LGが2026年9月10日(現地時間)付けで公開した論文が、Mixture-of-Experts (MoE) モデルが学習データの繰り返しに対して、高密度活性化Transformerモデルよりも過学習しやすいことを指摘した。人間が作成したテキストデータの供給が枯渇する中、言語モデルの学習データ繰り返しは一般的な手法となっている。この研究は、MoEの性能劣化がデータの繰り返し率に大きく依存し、その影響がスパース性と共に増加することを示している。