arXiv cs.CVは10月8日(現地時間)、Hongxing Li氏らの研究チームが、VLM(Visual Language Model)エージェントの性能向上を目指す新たな視覚ネイティブなスキル学習フレームワーク「ViSkill」を提案する論文を公開した。このフレームワークは、従来のテキスト中心のアプローチが抱えていた幾何学的構造情報の損失という課題を克服。成功した相互作用を直接視覚スキルカードとしてエンコードすることで、スキル蓄積とポリシー改善の相互強化を実現する。
Li氏らの研究チームが開発した「ViSkill」は、VLMエージェントが視覚的タスクをより効率的に学習し、実行するための画期的な手法を提供する。このフレームワークの核心は、成功裏に完了した相互作用を、複合的な視覚スキルカードとしてVLMエージェントが直接利用できるようにする点にある。
具体的には、これらのスキルカードは、エージェントの推論プロセスを効果的に導き、報酬整形を通じて学習を促進する重要な役割を果たす。これにより、エージェントは過去の成功体験から直接学び、新たな状況での意思決定能力を向上させることが可能となる。
さらに、ViSkillは閉ループのフィードバック機構を採用している。この機構では、エージェントがタスクを成功させた際の軌跡が、継続的にライブラリに蒸留される。このプロセスを通じて、スキル蓄積とポリシー改善が相互に強化され、エージェントの性能が反復的に向上していく。特に、オプションとして提供されるコールドスタート機構は、学習の初期段階における加速に大きく寄与し、効率的な訓練を支援する。
ViSkillの有効性は、Sokoban、FrozenLake、PrimitiveSkillといった複数の環境を用いた評価で実証された。評価では、ViSkillが全体で0.89という高い成功率を達成。コールドスタート初期化を適用した場合は成功率が0.91に向上し、既存のプロプライエタリおよびオープンソースのベースラインモデルを全て上回る結果を示した。加えて、標準的なPPO(Proximal Policy Optimization)アルゴリズムと比較して、より高速な学習収束が確認されており、効率的な学習プロセスを裏付けるものとなっている。
研究チームは、この研究成果を広く利用してもらうため、関連するコードを公開している。これにより、VLMエージェントのさらなる研究開発や実世界への応用が加速されることが期待される。
参考: arXiv cs.CV (アーカイブ) — 2026年10月9日 02:44 (JST)
原文ハイライト"Reinforcing VLM Agents with Evolving Visual-Native Skills"