新オートエンコーダがテキスト損失圧縮を高度化、arxivで論文公開
Vinko Sabolčec(ヴィンコ・サボルチェツ)氏、Angelos Katharopoulos(アンゲロス・カサロプーロス)氏、David Grangier(デイビッド・グランジェ)氏らは10月8日(現地時間)、テキストの圧縮された潜在表現を学習する新しいオートエンコーダアーキテクチャに関する論文をarXiv cs.CLで発表した。この研究はデータ圧縮と表現学習の交差領域を探索し、残余ダウンスケーリングとアップスケーリング、低次元離散ボトルネックを特徴とする。提案手法はウェブテキストデータにおいて1バイトあたり2.24ビットでロスレステキスト圧縮アルゴリズムと同等の圧縮表現を実現し、良好な再構築性能と下流タスク性能を両立すると報告している。