砍掉210倍遥操数据!最新的Isaac 0.5,正在改写机器人数据的成本结构
具身智能之心·2026-08-27 21:00

文章核心观点 - 人形机器人最大瓶颈已从硬件转向大脑和软件[1] - 美国创业公司Perceptron发布的Isaac 0.5模型通过数据分工和视频Scaling,大幅降低昂贵真机数据需求,可能重塑具身智能产业链的数据经济账[11][40] Isaac 0.5模型核心特征 - 模型参数36B,动态稀疏MoE架构,256个路由专家,每个token最多选8个,含Null Expert跳过不必要计算,平均每个token实际激活约2.5B参数[55] - 训练数据包含100万小时通用视频、37.5万小时第一视角Ego视频、37.5万小时UMI手持夹爪视频、10万小时机器人相关数据,覆盖35种以上机器人配置[31] - 10万小时机器人数据中:1万小时高质量遥操作示范、4万小时更广泛机器人交互轨迹、5万小时游戏与仿真数据[18] - 模型开源权重[3] - 采用统一36B稀疏backbone,视频理解、空间定位、具身推理、任务进度判断及机器人控制共享同一套表示[46] - 引入Percept概念,训练模型预测未来画面中与任务相关的可见状态变化,而非全部像素[51] - 离散动作走2048个FAST token,连续控制由Flow expert和36层DiT生成action chunk[55] 数据效率与Scaling路线 - 当通用视频从1000小时扩大到100万小时,为达到action loss=2.50阈值,遥操作数据需求从5884小时下降到28小时,约210倍[34][35] - 视频不能无条件替代机器人数据:当遥操作数据仅1小时时,增加视频收益曲线几乎持平;从约100小时真机数据开始,视频Scaling收益才稳定[37] - 昂贵的真机数据正从“主粮”变成“引子”,量未必无限增加,但质量、覆盖范围和动作grounding能力更重要[40] - 不同数据分工明确:通用视频负责看广世界,Ego和UMI拉近交互观察,真机数据完成动作接地[30] 与主流模型对比 - 与π0.7对比:π系列持续证明机器人基础模型能力上限,Isaac 0.5更重视数据经济账[63] - 在LIBERO-Long上,Isaac 0.5零样本成功率仅6%,更新Flow/DiT动作专家后达91%,加入接口投影达92.5%,全量微调为93%[64] - 与Google Gemini Robotics 2对比:Google做最强闭源通用智能,Perceptron押开放模型+规模化数据方法[69] - 与NVIDIA GR00T N1.7对比:GR00T N1.7为3B参数、开放跨本体VLA,加入约2万小时EgoScale视频,背后有完整开发流水线[72][73] - 推理性能对比:Isaac 0.5延迟70ms、策略率14.3Hz、检查点36GB;GR00T N1.7延迟27.9ms、策略率35.9Hz、检查点6.93GB[78] - 中国团队方向:原力灵机DM0.5开放基础模型及适配checkpoint[80];ACE-Brain-0.5为8B统一模型[81];腾讯HY-Embodied-0.5提供2B端侧和32B复杂推理版本[82] 产业链影响 - 数据竞赛进入第二阶段:从拼资产规模转向拼数据转化效率[92][93] - 数采公司需重新评估数据价值,仿真公司需证明数据增益层级,模型公司需证明多模态汇入动作能力,本体厂希望“换身体不用换脑子”[95] - 下游客户核心关注:让机器人学会新任务还需花多少钱[95] - 模型接入LeRobot,公开机器人配置,用视频Scaling降低开发者自采真机数据压力[76] - 关键悬念:Percept目标构造和loss仍闭源,210倍为离线action-loss测量,不等于真实部署成本已下降210倍,外部复现至关重要[95]

砍掉210倍遥操数据!最新的Isaac 0.5,正在改写机器人数据的成本结构 - Reportify