arXiv cs.LGは9月30日(現地時間)、ドゥルハン・ジャヤラス氏とオイウィ・パーカー・ジョーンズ氏による研究論文を公開した。非侵襲的な脳記録からの単語復号において、先行研究が達成した精度向上の主要因が、脳活動の時間的特性を利用した「近道」によるものだったと指摘。この近道を除去すると、脳データを使わない合成信号でも同程度の精度が再現される一方、実際の脳記録を用いた新手法では精度が大幅に向上したことを明らかにした。
研究は、持続的に音声を聞く被験者の脳活動時系列データを単語開始時点から固定長ウィンドウに分割し、ニューラル・ネットワークが文中の全単語をまとめて予測する先行手法を検証対象とした。
先行手法では隣接するウィンドウが部分的に重なり合う設計となっており、この重なりによって単語間の間隔が暗黙的に明らかになっていた。単語の持続時間を示すこの情報こそが、脳活動そのものへの依存度を下げながら単語予測の精度を高めていたとみられる。研究チームが脳情報を含まない合成信号で検証したところ、バランス精度は22.0%に達し、実際の脳記録を用いた場合の22.3%とほぼ同水準だった。この合成信号は脳活動を含まず、単語の開始位置と持続時間のみを反映して生成されたものだったとみられる。
ジャヤラス氏とパーカー・ジョーンズ氏は、この時間的な近道を取り除くため、文中の全ウィンドウを一括でエンコードする方式を改め、各ウィンドウを独立して処理する方式に変更した。この変更により、ニューラル・ネットワークは脳記録に含まれる単語固有の情報そのものを学習する必要に迫られ、結果として性能が向上した。同じ単語に対する複数の異なる神経応答から予測を統合する戦略、および事前学習済み大規模言語モデルを言語事前確率として用いる戦略は、いずれも近道排除後に以前より大幅に効果を発揮するようになった。
研究チームはこの手法を「SimpleB2T」と命名した。知覚された音声を対象とするベンチマークでは、単語あたり5回の観測を用いた条件で単語エラー率36.6%を記録した。条件は異なるものの、過去の侵襲的な手法による音声復号の性能に近い水準に達している。侵襲的な手法は一般に外科手術による電極埋め込みを伴うのに対し、今回の非侵襲的な手法は頭皮上からの記録に基づいている点で異なる。
今回の結果は、脳からテキストへの復号研究において看過されてきた近道の存在を浮き彫りにするものであり、同種の近道を排除する検証作業が他の復号手法にも必要となる可能性がある。論文はarXiv cs.LGに9月30日付(現地時間)で公開された。
参考: arXiv cs.LG (アーカイブ) — 2026年10月1日 02:59 (JST)