Workflow
具身推理(Embodied Reasoning)
icon
搜索文档
谷歌连发三模型,把机器人调教成“全能打工人”!几小时速配、从头控到脚,还能“组团”开干
AI前线· 2026-07-31 15:22
核心观点 - Google DeepMind发布Gemini Robotics 2模型系列,标志着机器人发展进入新阶段,该模型能控制多种机器人自主适应不可预测环境,并解锁广泛任务范围[2] 模型能力与演示效果 - 实现从桌面任务扩展到人形机器人的智能全身控制,例如Apollo 2人形机器人能自主执行“把浇水壶放到底层架子的绿色箱子里”的指令[3] - 具备精细操作能力,包括将书籍放到书架、收拾棋盘、将磁带放入手提式录音机、整理桌面等[4] - 为不同硬件平台赋予高度灵巧性,能控制五指手完成打结或拧灯泡等动作,透过22自由度五指SharpaWave手执行打结、密封夹链袋等极度精细动作[5] - 能管理标准两指平行夹爪(如Franka Duo平台)完成紧密包装等复杂任务[5] - 谷歌内部评估报告显示,在三种全身操控类别中,成功率介于45.7%至76.3%之间[6] - 在三种Franka Duo抓取器类别中,成功率介于74.2%至89.6%之间[6] - 多指任务的成功率介于32%至92%之间[6] - 演示视频展示的是“完全自主”机器人的“实时录像”,与Elon Musk旗下Optimus机器人使用远程操作员形成对比[6] - 该模型是经过专门训练来执行视频中的每一项任务,训练方式结合了人工远程操作、视频示例和模拟[6] 三大核心模型架构 - Gemini Robotics 2包含三个具备高度能力的模型,各自肩负不同任务[8] - Gemini Robotics 2作为最先进的视觉-语言-动作(VLA)模型,能将视觉与语言输入转换为马达控制,实现从脚到指尖的完整人形机器人控制,并大幅提升双手与夹爪的灵巧操作能力[8] - Gemini Robotics 2首次实现了将意图转化为人形机器人的智能全身动作[8] - Gemini Robotics ER 2是一款“具身推理”视觉语言模型,扮演机器人大脑Agent角色,能与人类沟通、理解物理世界,并规划长达数分钟的多步骤任务[8] - Gemini Robotics ER 2新增了机器人团队协作功能,不同类型的机器人能够相互通信并协同工作[8] - ER 2模型能处理涉及数百个决策的复杂任务,并具备自我修正机制[10] - ER 2模型支持多机器人协作,让不同类型的机器人共同完成单机无法负荷的工作流[10] - Gemini Robotics On-Device 2是一款专为设备本地端运行的VLA模型,主打极高的适应效率[12] - 该模型原生支持多本体,并继承了Gemini Robotics 1.5中的先进“运动迁移”技术[12] - 现在只需数小时的适应时间(通常少于200个示例)就能适应新的双臂机器人本体[12] - 即使面对形状、传感器和自由度截然不同的新本体,该方法同样有效[12] - Gemini Robotics ER 2已在Google AI Studio提供,并在Gemini Enterprise Agent Platform展开私人预览[12] - VLA与本地端模型则仅对早期合作伙伴开放[12] 安全性与具身推理 - Google DeepMind正采取多层次方法,将传统物理安全措施与强大的AI安全框架相结合,来确保未来机器人的安全性[14] - Gemini Robotics 2特别推进了机器人在应对现实世界不确定性以及与人类协作方面的安全性[14] - 推出了ASIMOV-Agentic,这是一个用于代理式安全编排和不确定性解决的新基准[14] - ASIMOV-Agentic衡量具身推理智能体拒绝VLA发出的不安全工具调用请求的能力[14] - ASIMOV-Agentic也衡量智能体预测任务是否可能完成以及在不明确时主动请求人工干预的能力[14] - 通过增强的具身推理,Gemini Robotics ER 2在安全约束遵循和人类接近度基准上是其迄今为止最安全的机器人模型[14] - 当有人靠近时,Gemini Robotics ER 2能够成功停止人形机器人,并在区域无人后自主恢复工作[14] 行业背景与影响 - 让AI真正走入物理世界正成为科技巨头在通往通用人工智能(AGI)道路上的角力关键[3] - Google DeepMind表示这是“在迈向所谓的物理AGI(即让机器人能够完成人类能做的任何事情)道路上的又一个里程碑”[3] - 未来机器人将能与人类并肩工作,解决复杂挑战[3] - 目前大多数机器人都是预先编程或远程操控的,只能执行狭窄、重复的任务序列,缺乏真正的自主学习和适应不可预测环境的能力[7] - 将学到的技能从一个机器人本体迁移到另一个本体仍然极其困难[7] - 为了大规模应对最具挑战性的问题,各种形状和尺寸的机器人都需要AI模型赋予它们智能思考、行动和交互的能力[7] - 谷歌这次做的是软件层面,不是机器人本体[15] - 近期美国刚刚以安全为由禁止未来销售中国制造的机器人[15] - 这款软件可能运行的许多机器本体,恰恰是在中国制造的[15]