ジアナン・パン氏らは10月3日(現地時間)、感情認識スピーチ言語モデル「EMODE」を開発したと発表した。同モデルは、「Dynamic Para-Semantic Experts (DPSE)」を中心に構築されており、既存の大規模スピーチ言語モデルが課題としていた、感情を含むパラ言語的手がかりの保存を目指す。これにより、統一されたクロスモーダルな理解と生成を可能にする。

既存のシステムは、絡み合った音響表現に依存することが多く、基盤となる言語モデルが音響的・プロソディックな証拠に挙動を根付かせるのではなく、回復された語彙内容に過度に依存する傾向があった。

EMODEは、この限界に対処するため、DPSEを通じて連続した音声特徴を意味的経路とパラ言語的経路に分解し、これらを動的にルーティングした後、言語モデルに統合する。

この構造的分解を機能的な特殊化へと転換するため、EMODEは3段階のカリキュラムで訓練される。これには意味的ウォームアップ、パラ言語的アクティベーション、結合的な洗練が含まれ、Orthogonal Expert Guidance (OEG)、Semantic-to-Acoustic Alignment (SAA)、そしてGating Diversity Regularization (GDR)によって導かれる。

「SERテスト」、共感的応答評価、および新たに構築されたバイリンガル「MEPAベンチマーク」を用いた実験結果が示された。EMODEは、語彙の忠実性と感情的感度のバランスを改善し、情動に基づく応答生成を強化する。また、ロバストなクロスコーパス感情理解のための明示的なパラ意味的因数分解の価値も明らかになった。論文の著者には、ジアナン・パン氏、イーウェン・グー氏、シンゼ・リー氏、ルイ・ワン氏、ケージー・ホワン氏が名を連ねている。


参考: arXiv cs.CL — 2026年10月7日 13:00 (JST)

原文ハイライト

"EMODE improves the balance between lexical fidelity and emotional sensitivity"

この記事をシェア
X はてブ LinkedIn