リサーチ・論文

【速報】DeepMind、高精度音声認識モデル「Gemini 3.5 Transcribe」発表

DeepMindは2026年8月25日(現地時間)、新しい音声認識モデル「Gemini 3.5 Transcribe」を発表した。このモデルは、背景雑音や専門用語、言い淀みに対応し、生音声を正確で洗練された整形済みテキストに変換する。開発者向けにはGemini APIを通じて提供され、音声エージェントやリアルタイムキャプションツールなどの構築に活用できる。既にGeminiアプリやAndroid製品にも導入されている。

リサーチ・論文

アフリカ言語向けASRモデル「DONDO」発表、27言語バリエーションをカバー

ポール・アズンレ (PAUL AZUNRE) 氏は2026年7月23日(現地時間)、アフリカ言語向けのオープンな自動音声認識(ASR)基盤モデル群「DONDO」を発表した。このモデル群はw2v-BERT 2.0セルフ教師あり音声エンコーダーを基盤とし、21の単一言語モデルと5つの多言語モデルから構成される。ガーナ、シエラレオネ、ナイジェリア、セネガル、ケニア、ジンバブエにわたる27の言語バリエーションに対応しており、Hugging Face KhayaAI組織上でApache-2.0ライセンスの下で公開される。