Ben Gubler氏らの研究チームは2026年3月24日(現地時間)、科学論文公開サイトarXiv cs.CLに論文を公開し、多言語トークナイザーの包括的な評価を目的としたオープンソースフレームワーク「Tokka-Bench」を発表した。このフレームワークは、100の自然言語と20のプログラミング言語を含む計120の言語、および30以上の書記体系に対応する。Tokka-Benchは、バイト/トークン比率やユニークトークンカバー率など、5つの補完的な指標を通じてトークナイザーの品質を多角的に評価し、既存の多言語比較評価における標準化された多指標フレームワークの不足に対処する。
大規模言語モデル(LLM)の基盤技術であるサブワードトークナイザーは、テキスト処理の効率とモデルのパフォーマンスに不可欠だが、その品質は言語や書記体系によって大きく変動することが指摘されてきた。Tokka-Benchは、この課題に対し、各書記体系の特性を考慮した言語認識セグメンテーションを用いて評価を実施することで、より公平かつ詳細な比較を可能にする。
Tokka-Benchが採用する主要な評価指標は以下の通りだ。一つ目は「bytes per token」で、トークンあたりのバイト数を示し、エンコード効率を測る。二つ目はunique token coverageで、語彙内で頻繁に出現するサブワードがどれだけカバーされているかを示す。三つ目はsubword fertilityで、一つの単語が平均していくつのサブワードに分割されるかを表す。四つ目は「word-split rate」で、単語がトークナイザーによって分割される頻度を示す。最後にvocabulary compositionは、語彙全体の構成を分析し、特定の種類のトークンがどの程度含まれているかを評価する。これらの指標を組み合わせることで、単一の評価基準では見落とされがちなトークナイザーの特性を包括的に捉えることができる。
本フレームワークを用いた実験では、GPT-2、GPT-4、gpt-oss、Llama 3.1、Gemma 3、Qwen3、Kimi K2といった、計7つの主要なBPE(バイトペアエンコーディング)トークナイザーを、個々の言語設定内で詳細に比較した。この比較分析の結果、トークナイザーの性能において、語彙の絶対的なサイズよりも、その語彙がどのように割り当てられ、利用されるかという「語彙割り当て戦略」がより重要であることが判明した。これは、単に語彙を大きくするだけでなく、その設計と最適化がLLMの効率に大きく影響することを示唆する。
さらに、プログラミング言語のトークナイザー効率に関する分析では、近年のトークナイザー間において、自然言語プロファイルの多様性にもかかわらず、ある程度の性能収束が見られるという結論が示された。これは、プログラミング言語の構造的な特性が、異なるトークナイザー間での性能差を相対的に小さくしている可能性を示唆する。一方で、自然言語、特に形態論的に複雑な言語や多様な書記体系を持つ言語では、トークナイザーごとの性能差が顕著に現れることも明らかになった。
Tokka-Benchのフレームワーク、評価データセット、および実験結果を可視化するインタラクティブなダッシュボードは、研究コミュニティがトークナイザーの設計と評価をさらに深めるための公開リソースとして提供されている。
参考: arXiv cs.CL — 2026年10月8日 13:00 (JST)