リサーチ・論文

言語モデルの方言バイアス、開発全段階で蓄積

Elle (エル) 氏らの研究チームは8月24日(現地時間)、米学術系サイトarXiv上で論文を公開し、現代の言語モデル (Language Models、LMs) における方言による性能差が、その開発パイプラインの全ての段階で発生していると指摘した。同研究は、意味は変えずに表面形式のみが異なる英語方言コーパスを使用し、LMsが標準アメリカ英語 (Standard American English、SAE) と方言テキストを意味的に同等と認識する一方で、下流の性能差に繋がる表現上のギャップが生じていることを明らかにした。

リサーチ・論文

形態素構造を考慮した新トークナイザー「SuTRA」提案 インド系言語の課題解決へ

arXiv cs.CLは2026年6月5日(現地時間)、既存のサブワードトークナイザーが無視してきた形態素構造、特に語根と接辞の関係性を考慮した新しいアルゴリズム「SuTRA (Structurally-Unified Tokenization with Root Awareness)」が提案されたと明らかにした。形態素が豊富なインド系言語における「Morphological Shattering」と呼ばれる問題の解決を目指しており、この研究に合わせてヒンディー語、マラーティー語、グジャラート語向けの新しい形態素セグメンテーションデータセットも公開された。