arXiv cs.CVは10月3日(現地時間)、多種モダリティ大規模言語モデル (MLLMs) が生成する人間行動フィードバックの質を高めるための新たなフレームワーク「BoT-Feedback」に関する論文を公開した。この研究は、MLLMsの推論を生体力学的証拠に根拠付けることで、既存手法の曖昧さや解釈性の低さ、身体的に不自然な誤認識といった問題を解決し、より具体的で質の高いコーチングフィードバックを提供することを目指す。
この研究の中心となるのは、Biomechanics of Thought (BoT) と名付けられた四段階の推論フレームワークだ。このプロセスではまず、提示されたアクションを特定し、次にその動作において重要な身体部位を正確に局所化する。その後、専門家と学習者のパフォーマンスを定量的な生体力学的差異に基づいて詳細に分析し、最終的に解釈可能で実践的なコーチングフィードバックを生成する。
「BoT-Feedback」フレームワークは、プラグアンドプレイ型のBiomechanical Data Parser (BDP)によって強力にサポートされている。BDPは、入力されたビデオデータから必要な生体力学的記述子を自動的に抽出し、変換する役割を担う。さらに、専門家と学習者の動作のタイミングを正確に合わせるための高度なアラインメント戦略が組み込まれており、これにより比較分析の精度が向上する。研究では、ペアになった教師と学習者のビデオ、それに付随する3D骨格データ、様々な生体力学的属性、そして専門家によるコーチングアノテーションを含む包括的なベンチマークデータセット「BiomAF」も同時に導入された。このデータセットは、フレームワークの評価と今後の研究のための貴重な資源となる。
合計12種類のオープンソースおよびクローズドソースの多種モダリティ大規模言語モデル (MLLMs) を用いた広範な実験を通じて、「BoT-Feedback」フレームワークの有効性が実証された。これらの実験結果は、生体力学的証拠に基づいた推論が、フィードバックの全体的な品質、解釈の容易さ、およびシステム全体の堅牢性を一貫して向上させることを明確に示している。特に注目すべきは、「BoT-Feedback」が平均的な専門家評価スコアを2.07から2.95へと40%の大幅な改善を達成した点である。この改善により、比較的コンパクトなオープンソースMLLMsでも、より大規模でプロプライエタリなシステムに匹敵する、あるいはそれに近い性能を発揮することが可能になることを示唆している。
参考: arXiv cs.CV (アーカイブ) — 2026年10月7日 13:00 (JST)