动作流
搜索文档
机器人运动误差降低90.4%,英伟达/哈佛等提出Hydra-0,用Action Flow统一世界建模与控制
36氪· 2026-09-07 16:39
核心观点 - 英伟达与哈佛大学联合团队提出Hydra-0世界模型,通过动作流统一接口显著提升机器人运动与物体运动预测精度,并支持零样本组合与数据高效迁移 [1][2] 技术突破与性能表现 - 在最佳配置下,Hydra-0将机器人运动误差降低90.4%,物体运动误差降低60.2% [1][2] - 在RoboLab基准测试中,对重放实验与参考实验的成功率预测Pearson相关系数达r=0.96 [2][19] - 采用KV Cache的因果式自回归转换速度提高1.68倍,蒸馏后速度提升约9.5倍,最终达62.0帧/秒,相对原始方法实现16.0倍纯生成速度提升 [17][18] 模型架构与创新 - 将机器人动作表示为像素运动,作为统一视觉接口,跨越不同机器人本体、任务、环境及视频生成骨干网络 [2][7] - 框架包含正向模式(预测动作后果)和逆向模式(从物体运动推断机器人动作) [7][12] - 动作流由相机平面上的轨迹构成,描述机器人本体可见部分按指令产生的运动 [7] - 采用四种条件策略:Embodiment(主体轨迹)、Object(物体轨迹)、All(全部轨迹)、None(无轨迹) [8][9] 数据与训练 - 从7个数据源汇集多机器人本体训练语料库,包括DROID、ABC-130k、MolmoAct2、EgoDex、Deform360等 [4] - 主要保留可变形物体交互数据,包括布料、电缆、绳索、袋子和纸张 [5] - 采用三种窗口级筛选条件:静态窗口筛选(路径长度低于50像素)、夹爪冻结筛选(运动幅度低于50像素)、无内容语言描述筛选 [6] - 多机器人本体中期训练在0%数据条件下,全部六项任务中LPIPS、物体流EPE和FVD均优于仅后训练模型 [16] 应用与验证 - 在真实世界机器人环境中对折叠衣物轨迹进行重放,定性保留了原始任务中不同结果 [20] - 通过世界动作模型,能从人类示范中的目标物体运动流反推出匹配的机器人运动并转化为可执行动作 [20] - 模型存在厘米级抓取误差,对深度及接触状态理解有限,腕部摄像机和移动操作场景尚缺乏系统验证 [21]