VLMエージェント性能向上へ、視覚スキル学習フレームワーク「ViSkill」提案
arXiv cs.CVは10月8日(現地時間)、Hongxing Li氏らの研究チームが、VLM(Visual Language Model)エージェントの性能向上を目指す新たな視覚ネイティブなスキル学習フレームワーク「ViSkill」を提案する論文を公開した。このフレームワークは、従来のテキスト中心のアプローチが抱えていた幾何学的構造情報の損失という課題を克服。成功した相互作用を直接視覚スキルカードとしてエンコードすることで、スキル蓄積とポリシー改善の相互強化を実現する。