谷歌发布新一代机器人AI模型 剑指“灵巧性”难题

🤖 由 文心大模型 生成的文章摘要

谷歌DeepMind发布了面向机器人的新一代人工智能模型,旨在使人形机器人能够协调全身动作,并具备更强的推理与任务规划能力。这是谷歌将Gemini AI技术进一步拓展至机器人领域的最新举措。

新系统被命名为Gemini Robotics 2。与此前主要控制上半身的模型不同,该模型实现了对整个人形机器人的全身控制,使机器人能在执行任务时同步完成行走、下蹲、操控物体等复合动作。

在一段预录演示中,DeepMind模型操控Apptronik公司的人形机器人Apollo,展示了穿过房间、避开障碍物、拿起洒水壶并将其放到架子上的完整流程。

与此同时,DeepMind还发布了另外两款协同工作的模型:

Gemini Robotics 2:负责将摄像头画面和自然语言指令,实时转换为机器人的电机控制指令。

Gemini Robotics ER 2:充当机器人的“推理系统”,负责规划多步骤任务,并可协调多台机器人共同完成同一目标。

在关键的能力突破上,谷歌展示了机器人灵巧性的提升。测试中,系统完成“拧下灯泡”这一精细任务的成功率达到92%。不过,在处理扎垃圾袋、封好密封袋等更复杂的操作时,成功率仍然相对较低。

安全方面,谷歌推出了一套新的评测基准,并声称Gemini Robotics ER 2是其迄今最安全的机器人模型,尤其在识别不确定情况、拒绝执行风险指令以及避让人类方面表现更佳。

根据发布计划,Gemini Robotics ER 2将通过谷歌开发者平台AI Studio开放,并在企业级平台提供私人预览;更专业化的模型将率先向早期合作伙伴及100多家测试机构开放。谷歌已开放开发者候补名单,并正与Apptronik、Agile Robots SE以及Boston Dynamics等核心合作伙伴展开合作。

DeepMind机器人业务副总裁Carolina Parada表示:“我们的目标是将AI带入物理世界,并构建一层能被所有机器人使用的智能系统。”但业务总监Kanishka Rao也坦言,真正实现媲美人类的灵巧性仍任重道远。目前机器人动作依然缓慢谨慎,需要在执行中停下来思考人类凭直觉完成的决策,且学习效率远低于人类——人类一两次错误即可调整行为,而机器人远未达到此水平。

此次发布基于谷歌2025年推出的Gemini Robotics,标志着其重新点燃了机器人战略。与此同时,竞争对手OpenAI和英伟达也在积极布局机器人AI领域。