头版Folia Daily Briefing
← 返回头版
科技人工智能

谷歌推出Gemini Robotics 2机器人通用模型 实现全身协调控制

Google DeepMind推出了Gemini Robotics 2机器人通用模型,采用"全身智能"架构,通过统一的视觉-语言-动作(VLA)模型来协调人形机器人的双腿、躯干、双臂和手指完成复杂动作[1]。这一设计突破了以往将机器人各部位作为独立模块控制的方式,转而用单一模型统一全身动作控制[1]。

该系统由三个子模块组成:ER 2负责环境理解和任务规划,Robotics 2 VLA模型将视觉与语言信息转化为具体动作指令,On-Device 2则将动作模型部署至本地设备并支持快速适配[1]。在官方测试中,Apollo机器人从桌面、地面和货架取物的平均成功率分别达到68.4%、45.7%和76.3%[1]。多指灵巧手的任务表现方面,拧下灯泡的成功率为92%,拧上灯泡、扎垃圾袋、使用簸箕、封自封袋的成功率分别为36%、44%、32%和40%[1]。

On-Device 2模型的适配能力突出,仅用少于200个样例和几小时的数据就能适配新的机器人本体[1]。该模型已被应用于搭载不同灵巧手的Apollo 2和使用两指夹爪的Franka Duo等多种机器人平台[1]。官方发布的演示视频中所有机器人均为自主运行,动作按真实速度播放[1]。


Google DeepMindGemini Robotics 2人形机器人全身智能具身智能