マハム・タンヴィール (Maham Tanveer) 氏らは9月30日(現地時間)、ベクトルグリフ (vector glyph) をアニメーション化して意味概念を表現する新たな手法「モーダル・キネティック・タイポグラフィー (modal kinetic typography)」に関する研究論文を発表した。この技術は、グリフの自然な振動モードから動きを構築することで、可読性を維持しつつ滑らかなアニメーション生成を可能にする。論文は学術論文公開サイトarXivで公開された。
本手法の主要なアイデアは、有限要素固有値問題 (finite-element eigenproblem) を用いてベクトルアウトラインからグリフの最も柔らかいモードを導出することにある。これにより、文字全体およびその各パーツが曲がることが可能となる。さらに、ゼロエネルギー解 (zero-energy solutions) である剛体並進 (rigid translations) と回転 (rotations) を各パーツに適用することで、パーツをブロックとして動かすことも実現する。
アニメーション生成には、凍結ビデオ拡散モデル (frozen video diffusion model) がモードの振幅と位相を監督する。このモーダルアプローチは、従来の自由形式点最適化において発生しがちなアウトラインの破損やジッターといった課題に対処する。本手法のモードはアウトラインに沿って滑らかであり、数少ない全サイクル高調波によって駆動されるため、滑らかでシームレスにループする動きに限定される。
従来の構造化された代替手法がカテゴリ固有の事前知識に依存するのに対し、本手法のモードはグリフ自体から導出される。唯一の事前知識は、言語モデル (language model) によってアルファベット全体に対して一度生成された、各文字の可動パーツを命名するリストである。このモーダル・キネティック・タイポグラフィーでは、形状と動きが構成上分離されており、単一のベースアウトラインは概念に合わせて形成され、モーダル駆動によって変更されないため、文字が再形成されずにアニメーション化することも可能となっている。
本手法は、ダイナミック・タイポグラフィー (Dynamic Typography) やアニクリップアート (AniClipart) と比較して、より明確で滑らかな動きを生成し、同等またはそれ以上の概念整合性を達成する。また、ダイナミック・タイポグラフィーよりもグリフの破損が少なく、人間の評価者からも高い評価を得ている。特に、形状が固定された設定で動きのみが概念を伝える場合においても優れており、アストラ (Astra) の結果よりも人間の評価者によって好まれたと報告されている。
参考: arXiv cs.CV (アーカイブ) — 2026年10月1日 13:00 (JST)