Jenna Russellらの研究チームが2026年9月30日、AI生成ウェブテキストが言語モデルの事前学習に与える影響を分析した論文をarXiv cs.CLで発表した。ウェブデータ中のAI生成トークンの比率は2026年6月の27.5%から同年8月には31.1%へ上昇したと指摘し、データ不足のモデルではAIトークンの追加が一時的に損失を減らす一方、過剰な追加は逆効果に転じ、データが潤沢なモデルでは早期から損失が増加する傾向を報告した。
研究は、ウェブテキストが言語モデルの事前学習データの大半を占める中、AI生成コンテンツの増加がもたらす影響を定量的に検証した。品質フィルタリングツールFineWebを適用した後のウェブデータについて、検出ツールPangramを用いてAI生成と分類されたトークンの割合を調べたところ、2026年6月時点で27.5%、同年8月には31.1%に達していたことが判明した。
研究チームは、AI生成トークンと人間生成トークンの混合比率を意図的に変化させた言語モデル800種を事前学習し、得られた結果からスケーリング法則を導いた。分析によると、人間生成テキストのデータ量が不足しているモデルでは、AIトークンを追加すると当初は損失が減少するものの、追加量の増加とともに効果が飽和し、最終的には性能を悪化させる方向に転じた。一方、人間生成テキストの予算が十分なモデルでは、AIトークンの追加はほぼ即座に損失の増加を招いたという。
Hoffman et al. (2022)らが示した既存のスケーリング法則では、こうしたAIトークンの効果の符号反転を説明できないと研究チームは指摘する。そこで、AIトークンが存在しない条件下ではChinchillaのスケーリング法則に帰着しつつ、AIトークンの価値が正負を変える挙動を表現できる新たな法則を提案した。小規模モデルで適合させたこの法則は、最大3.6倍大きいモデルにおける人間生成テキストの損失予測において、既存の最良の法則と比べて41%低い誤差を達成したとしている。
研究チームは、学習の目標が人間生成テキストの性能向上にある場合、AI生成テキストのフィルタリングや人間生成テキストの反復利用を推奨する一方、目標がAI生成テキストの性能である場合にはAIテキストに依然として価値があるとの見解を示した。成果として、AI・トピック・フォーマットのラベルを付した83Bトークン規模のコーパス「WildAI」と、学習済みの800モデルおよび関連コードを公開している。原論文はarXiv cs.CL(https://arxiv.org/abs/2609.40295)に掲載された。
参考: arXiv cs.CL — 2026年10月1日 02:50 (JST)
原文ハイライト"Scaling Laws for Wild AI-Generated Web Text"