Szymon Kocur氏らは2026年10月6日(現地時間)、1800年から1918年にかけて出版されたポーランド語のテキストを収集した大規模コーパス「Wieszcz-XIX (ヴィエシュ-XIX)」を公開した。このコーパスは約3.1 billion語 (6.75 billionトークン) からなり、機械学習モデルの訓練に利用できる。既存の同期間の注釈付きコーパスと比較して3桁以上大規模となる。

Wieszcz-XIXは、オンライン図書館Wolne Lektury (ヴォルネ・レクチュリ) とInternet Archive (インターネット・アーカイブ) から収集された294,369件の文書で構成される。これらの文書は主に定期刊行物である。

データ収集の過程では、フィルタリング、重複排除、および1918年以降のテキスト混入(post-1918 leakage)の監査が厳格に実施された。しかし、学習コーパスから除外された後も、転写元に含まれる既知の残渣として、0.04%から0.38%のバイトの漏洩が確認されている。手動で修正されたサンプルでは、判読可能なテキストにおける文字エラー率は0.68%であったものの、サンプリングされた箇所の45%は修正不能であった。

研究チームは、このWieszcz-XIXコーパスを用いて、47Mから349Mパラメータを持つデコーダーのみの言語モデルをゼロから訓練した。これらのモデルは、時間的境界性(temporal boundedness)が測定され、現代ポーランド語ベースモデルと比較して異なる特性を示した。特に349Mパラメータのモデルと107Mパラメータのモデルは、1918年以降の語彙が期間内の語彙よりもバイトあたり約3.1ビット多くコストを要するクロスオーバーを示している。期間内のテキストが与えられた場合、訓練されたモデルは当時のスペルを保持する一方、比較対象モデルは部分的にしか保持しないという結果も得られた。

研究者らは、Wieszcz-XIXコーパス、関連するコード、および訓練済みモデルのウェイトを公開している。ただし、これらのモデルは、反ユダヤ主義的記述を含む、対象期間の社会における偏見を再現する可能性があるという注意書きが添えられている。


参考: arXiv cs.CL — 2026年10月9日 13:00 (JST)

原文ハイライト

"Wieszcz-XIX: A 3.1-Billion-Word Corpus of Pre-1918 Polish and Temporally Bounded Language Models Trained From Scratch"

この記事をシェア
X はてブ LinkedIn