Metaは9月29日(現地時間)、Kuan-Po Huang氏らの研究者チームが、感情表現豊かなテキスト読み上げ(TTS)モデルの制御性を向上させる新手法「EmoRES(Emotion Residual-Enhanced Steering for TTS)」を提案したと発表した。この新規手法は、感情ベクトルを共有成分と残差成分に分解することで、既存モデルの追加学習なしに感情表現の精度を高めることを目指す。
EmoRESは、感情を条件とするTTSモデルが、要求された感情を信頼性高く表現できないという課題に対し、学習不要のアプローチであるベクトルステアリングを研究した成果である。従来のベクトルステアリング手法「CoCoEmo」は、個々の感情ベクトルを単一の方向として扱い、要求された感情への適合性に限界があった。
本研究では、感情ベクトルが中立的な表現から音声を遠ざける「共有成分」と、要求された感情へ生成を導く「残差成分」に分解できることを発見した。この知見に基づき、EmoRESはモデルのバックボーンを再訓練することなく、これら二つの成分を独立して制御する新しい手法を提示している。
IEMOCAPデータセットを用いた評価では、IndexTTS-2およびCosyVoice2のバックボーンにおいて、EmoRESがCoCoEmoを全ての客観的感情指標で上回った。ランク相関はIndexTTS-2で26.13ポイント、CosyVoice2で12.97ポイント改善し、それぞれ118.8%および33.1%の相対的向上を示した。感情ヒット率もIndexTTS-2で12.95ポイント、CosyVoice2で6.92ポイント改善し、それぞれ20.1%および9.8%の相対的向上を記録した。
人間による評価では、リスナーが要求された主要な感情を正しく識別した割合が最大35.0%相対的に向上し、忠実度も最大17.3%改善した。自然さのペアワイズ比較では、EmoRESが最大63.8%のケースでリスナーに好まれた。成分除去実験により、感情ステアリングベクトルの共有成分を保持しつつ残差成分を強化することが、効果的な制御に寄与することが示されている。
参考: arXiv cs.SD — 2026年9月30日 02:59 (JST)
原文ハイライト"EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation"