形態素構造を考慮した新トークナイザー「SuTRA」提案 インド系言語の課題解決へ
arXiv cs.CLは2026年6月5日(現地時間)、既存のサブワードトークナイザーが無視してきた形態素構造、特に語根と接辞の関係性を考慮した新しいアルゴリズム「SuTRA (Structurally-Unified Tokenization with Root Awareness)」が提案されたと明らかにした。形態素が豊富なインド系言語における「Morphological Shattering」と呼ばれる問題の解決を目指しており、この研究に合わせてヒンディー語、マラーティー語、グジャラート語向けの新しい形態素セグメンテーションデータセットも公開された。