Appleは2026年7月27日(現地時間)、Siri Expressive Voicesにおける記憶効率の高いオーディオ合成アーキテクチャを発表した。この技術は、Appleのオンデバイス基盤モデルであるAFM 3 Core Advancedを基盤とし、Apple Matrix Coprocessor (AMX) の限られた計算資源とメモリ予算内で高忠実度オーディオを生成するデトクナイザーを採用している。

発表されたアーキテクチャは、基盤モデルが生成するセマンティックオーディオトークンをResidual Vector Quantization (RVQ) 表現に変換する。この変換は、ストリーミングエンコーダー、テンポラルデコーダー、デプスデコーダーからなる3コンポーネント設計によって行われ、テンポラル処理とデプス処理を体系的に分離する。

Diffusion Transformer (DiT) スタイルのステージコンディショニングを持つ単一の再利用可能なデプスデコーダーが、全てのRVQレベルを自己回帰的に生成することで、従来のマルチデコーダーアーキテクチャにおける専用のレベルごとのデコーダーを置き換えている。また、固定ウィンドウキーバリューキャッシングを備えた因果的なスライディングウィンドウアテンションにより、シーケンス長に依存しない一定のメモリ複雑性が実現される。AMX上に展開されたデトクナイザーは、1生成ステップあたり約10msで動作し、これはリアルタイムの約16倍の速度に相当する。ピークランタイムメモリは約21MB、オンデバイスアセットは329MBであり、オンデバイス基盤モデルと並行して20〜320秒のオーディオ連続ストリーミング合成を可能にする。

このアーキテクチャは、従来のTransformerベースやGANベースのアプローチに見られる線形および二次的なメモリ拡張を置き換える。音声品質評価では、音素識別性分析、知覚品質指標、ニューラル品質推定を通じて、計算効率を向上させつつ合成忠実度を維持していることが確認された。この技術はSiri Expressive Voicesの一部として既に製品に展開されており、Apple DevicesにおいてPace and Expressivity customizations slidersやカスタムアシスタント音声に対応する。

AFM 3 Core Advanced内では10億パラメーターのアクティベーションサイズで動作し、以前のオンデバイステキスト読み上げシステムと比較して、Mean Opinion Score (MOS) を全体で+0.28 (4.15対3.87)、会話音声で+0.42 (4.24対3.82) 向上させている。Appleは2026年6月8日にもApple Foundation Modelsの第3世代について発表しており、Googleとの共同開発によりオンデバイスからサーバーベースまで多様なモデルを提供している。


参考: Apple ML Research (アーカイブ) — 2026年7月28日 09:00 (JST)

原文ハイライト

"replaces the linear and quadratic memory scaling of conventional transformer- and GAN-based approaches."

この記事をシェア
X はてブ LinkedIn