Workflow
机器人技术
icon
搜索文档
π0引用的中国团队,又出手了:世界仿真器新作发布
量子位· 2026-08-18 15:48
核心观点 - Current Robotics团队发布交互式世界仿真器CurrentWorld-0,首次将跨本体、多视角、力-触觉预测整合进同一系统,旨在为不同形态机器人提供一个统一的、不会替策略纠错的物理仿真测试环境[6][7][12] 团队背景与技术积累 - 创始人祝毅晨曾任美的集团具身智能部部长,已发表40余篇顶会论文,学术引用超过5,200次[8] - 祝毅晨学术引用总数为5,290次,自2021年以来为5,203次,h-index为32,i10-index为43[9] - 团队是国内最早发布VLA及世界模型的研究者,曾提出扩散模型和VLM端到端的VLA范式(TinyVLA),拓展VLA+CoT策略(DiffusionVLA & DexVLA,发表至ICML和CoRL),并较早提出世界模型用于具身策略评估(dWorldEval,发表至ICML高亮论文)[9] - Physical Intelligence在其里程碑论文π0中引用了祝毅晨团队完成的TinyVLA与ScaleDP工作[10][11] - 团队从早期的VLA大模型、人类示教数据,逐步延伸至全身机器人学习,这些探索最终沉淀为Current Robotics的技术基石[11] CurrentWorld-0核心特性 动作可控性与不纠错原则 - 机器人世界模型起点为视频生成模型,但大量成功范例导致模型倾向于将失败动作“补回”成功结果,使评测失真[13][14][15] - 团队此前在dWorldEval中研究世界模型的动作可控性:动作发生变化,后面的世界也必须跟着变[16] - CurrentWorld-0的基本要求:机器人怎么做,世界就怎么变化;即使做错了,模型也不能替它把结果纠正回来[17][18] 跨本体建模 - 不同机器人(固定双臂、移动升降双臂、人形)执行同一任务时,输入给模型的动作完全不同[19][20] - CurrentWorld-0保留不同本体自己的Action Subspace,模型需将不同形式的动作继续往后推演[21][22] - 跨本体建模的难点:机器人可以换,动作接口可以换,但物体不会因执行者改变而突然改变物理规律[23][24] 多视角同步 - 机器人执行任务时同时依赖多个摄像头(第三视角、头部相机、腕部相机),一个动作发生后杯子会同时出现在多路画面中[26] - 问题从“这一帧生成得像不像”变为“几路画面能不能对得上”,任何一路出现漂移都会导致评测物理过程断开[27][28] - CurrentWorld-0需维持多个相机对同一次事件的共同记录,当前Demo可同步生成多路视角[29][30] 力-触觉预测 - 对于夹薯片或削黄瓜等任务,仅靠画面难以判断是否真正捏住或削下[31][32] - CurrentWorld-0将力觉和触觉也放进未来预测中,工具何时真正受力、接触是否发生、抓取是否稳定,这些状态会随机器人动作一起变化[33][34] - 完整评测需锚定从动作输入到环境响应、接触发生、物理反馈出现的连续过程[36] 人类接管与状态回滚 - 真机执行时中间状态难以原样复现,重新复位费时费力[37] - 在CurrentWorld-0中,策略自主执行后,操作员可通过遥操作直接接管,从当前位置继续完成后续动作[38][39] - 当前状态可被保存和回滚,一次尝试结束后可回到同一节点换一种方式继续推进[40][41] - 这延续了团队此前Hi-WM(Human-in-the-World-Model)工作的思路[42] - 每一次接管都会重新展开后续交互,操作员的纠正动作被完整记录,形成新交互轨迹,可用于policy post-training[42][43] 行业意义 - 机器人的形态未来会越来越多,但能力最终都要回到真实世界里接受检验[47][48] - CurrentWorld-0旨在扮演终点前的最后一道关:让那些还没被现实检验过的动作,先在这里跑一遍、错一遍、改一遍[50]