arXiv cs.SDは2026年8月19日(現地時間)、ボーカル模倣による音響効果検索のためのファインチューニング戦略に関する研究報告を発表した。この報告は、AES AIMLA 2025チャレンジ (AES AIMLA 2025 Challenge) での優勝提出物に関するもので、凍結済み事前学習済みCEDエンコーダを用いた対照学習と、MobileNetV3エンコーダを用いた半ハードネガティブ付き結合対照学習・トリプレット学習の2つの相補的なファインチューニング戦略を詳述している。

本報告書は、ボーカル模倣を通じて音響効果を検索する技術に焦点を当て、そのファインチューニング戦略について詳細に述べている。研究者らは、凍結された事前学習済みCEDエンコーダを使用する対照学習と、MobileNetV3エンコーダを使用し半ハードネガティブを組み込んだ結合対照学習・トリプレット学習という、2種類の戦略を検証した。

この報告書は、チャレンジ後に公開された詳細情報を含めるために更新されたもの。著者には、アディティヤ・バッタチャルジー (Aditya Bhattacharjee) 氏、クリストス・プラチョウラス (Christos Plachouras) 氏、ソンギュン・チャン (Sungkyun Chang) 氏、エマニュエル・ベネトス (Emmanouil Benetos) 氏が含まれる。


参考: arXiv cs.SD — 2026年8月20日 02:51 (JST)

原文ハイライト

"two complementary fine-tuning strategies: contrastive learning with a frozen, pretrained CED encoder"

この記事をシェア
X はてブ LinkedIn