Google、ロボットAI新モデル「ジェミニ・ロボティクス ER 2」を発表
Googleは7月30日(現地時間)、ロボット向けの新モデル「ジェミニ・ロボティクス ER 2 (Gemini Robotics ER 2)」を発表しました。このモデルは、ロボットの高度な「脳」としての機能強化を目指し、動画理解、タスクのオーケストレーション、複数ロボット間での連携能力を進化させます。リアルタイムでの空間推論、多段階にわたるタスク計画、そしてロボット間の協調作業を可能にすることが期待されています。
Tag
2 件の関連記事
Googleは7月30日(現地時間)、ロボット向けの新モデル「ジェミニ・ロボティクス ER 2 (Gemini Robotics ER 2)」を発表しました。このモデルは、ロボットの高度な「脳」としての機能強化を目指し、動画理解、タスクのオーケストレーション、複数ロボット間での連携能力を進化させます。リアルタイムでの空間推論、多段階にわたるタスク計画、そしてロボット間の協調作業を可能にすることが期待されています。
ゼンハオ・シン (Zhenghao Xing) ら研究者らは6月17日(現地時間)、長尺動画理解の計算コスト課題を解決する新たなオムニモーダルエージェント「OmniAgent」に関する論文をarXivで公開した。OmniAgentは、動画理解をPOMDPベースのObservation-Thought-Actionサイクルとして定式化し、推論の複雑さを動画の長さから分離する。このアプローチにより、既存のオープンソースモデルを超える性能を示した。