モハメド・アミン・チャディ氏らは9月30日(現地時間)、モロッコの公用語であるタマジクト語のクラウドソーシング型音声データセット「TutlAit v1」を公表した。タマジクト語は音声技術分野でリソースが不足しており、この課題に対応するためアラビア語の転写と地域アクセントのラベルを付与。専用ウェブアプリ「TutlAit」を通じてネイティブスピーカーからデータを収集し、音声認識や翻訳での応用が期待される。

データ収集には、専用に構築されたクラウドソーシングウェブアプリケーション「TutlAit」が活用された。このアプリケーションは、フロントエンドに「React 18」、バックエンドに「Django 5」とDjango REST Framework、データベースに「PostgreSQL」を採用している。「LinkedIn」と「Instagram」を通じたキャンペーンで募集されたタマジクト語のネイティブスピーカーは、地域の方言(「Atlas」、スース、「Rif」など)と人口統計情報を申告し、データに貢献した。

貢献方法は二つのワークフローに分かれている。一つは「Text-to-Audio」で、アラビア語の文章が表示され、ボランティアがブラウザ上でそのタマジクト語訳を音声録音する。もう一つは「Audio-to-Text」で、タマジクト語の音声抜粋が再生され、ボランティアがアラビア語で文字起こしを行う。補完的なデータセットは、自由にアクセス可能なタマジクト語の視聴覚メディアから取得され、「ELAN」でセグメント化およびアノテーションされた後、「CSV/ZIP」パイプラインを通じてインポートされた。アップロードされた各ファイルはサーバー側で16kHzモノラルWAV形式に変換され、重複排除のために「SHA-256」でハッシュ化される。

「TutlAit v1」データセットには、合計13,384の音声ファイルが含まれており、総時間は75,231秒(約20.9時間)、容量は約3.01GBに達する。地域別では、「Atlas」方言が9,956ファイル(14.08時間)、「Souss」方言が3,378ファイル(6.75時間)を占める。少数の「Rif」方言(22ファイル)と「Kabyle」方言(28ファイル)のサブセットも含まれている。このコーパスは、モロッコのタマジクト語における音声認識、音声翻訳、およびアクセント識別のための研究に再利用可能である。


参考: arXiv cs.CL (アーカイブ) — 2026年10月1日 13:00 (JST)

原文ハイライト

"Moroccan Tamazight speech dataset with Arabic transcriptions"

この記事をシェア
X はてブ LinkedIn