涌现
搜索文档
具身智能模型专家交流
2026-08-24 10:25
具身智能行业电话会议纪要关键要点总结 一、纪要涉及的行业与公司 * 行业为具身智能(Embodied Intelligence)领域,涵盖机器人本体、模型训练及数据采集[1] * 提及的海外公司包括Physical Intelligence(PI)、Dyna 2、谷歌、特斯拉、Figure(含Helix模型)、Covariant(前Beta Two)[7][13] * 提及的国内公司包括智元机器人、宇树科技、乐聚、优必选、字节、小鹏、小米[8][12] * 小米的CyberDog 2(铁蛋)被提及在工厂执行简单任务[17] 二、核心观点与论据 2.1 行业发展阶段与对标 * 具身智能处于GPT-2之前的早期阶段,主要成果是证明了规模化学习的有效性,但尚未出现稳定且具备强大任务泛化能力的模型[1][6] * 以100分为满分,所有参与者可能都处于10分以内的水平,领先者可能获得11分,其他参与者为5至6分[7] * 从GPT-2到GPT-3的跨越,具身智能面临的鸿沟比语言模型更大,涉及物理世界理解、物理接触、长程任务规划及从失败中恢复的能力[6] 2.2 技术路径:VLA与世界模型 * VLA模型在落地应用和执行成功率方面领先于世界模型[2] * 世界模型被视为重要未来方向,核心原因是具身智能模型普遍面临数据稀缺问题[2] * 世界模型与VLA最核心区别在于世界模型能兼容更多类型数据,尤其是包含弱动作信息的数据[3] * 未来两者并非互斥,而是会走向融合VLA模型可快速改造为世界模型,反之亦然[3] 2.3 数据采集方式与质量 * 数据采集规模化能力排序:Ego视角方案 > UMI类设备 > 遥操作[1][2] * 数据质量排序与规模化能力相反:遥操作和UMI类数据更优[2] * 遥操作数据质量高但需绑定特定机器人本体,规模化投入成本巨大[2] * UMI夹爪式设备规模化程度较好,但操作员长时间穿戴会产生不适[2] * 英伟达Eagle Scale方案通过第一人称视角佩戴设备捕捉双手动作,规模化采集能力被认为比较理想[2] * 头部机构的数据积累量级大约在十万到几十万小时,无法满足持续增长需求[2] 2.4 数据规模与训练成本 * 行业拐点取决于千万小时级数据训练效果,若Scaling Law持续生效将引发资源涌入[1][13] * 预训练与后训练数据配比约为1,000:1,即千万小时Ego数据配对万小时本体数据[1][14] * 头部公司每月资本开支约数千万元,数据成本占比最高(1,000万至2,000万元/月)[1][12] * 模型存储成本约每月数百万元,算力成本约每月2,000万元[12] * 作为参考,自动驾驶大模型团队月度成本约4亿至5亿元[12] 2.5 模型迭代关键变量 * 从PI-0到PI-0.5的迭代主要体现在数据层面(数据采集量持续增加)和模型层面(动作表征优化)[4] * 未来迭代关键变量更多集中在数据层面,包括数据规模扩大和数据训练方式优化[4] * 模型架构和动作表征带来的性能提升曲线,预计不如数据规模化(data scaling)带来的影响显著[4] 2.6 涌现现象与通用能力 * 涌现是指模型能根据少量上下文中的示例"依葫芦画瓢"完成任务,体现举一反三能力[3] * 更进一步的涌现是面对全新任务时,模型能依托过往任务经验组合出新解决方案[3] * 涌现现象不局限于特定预测方向(预测下一帧或预测动作),核心在于通用能力的体现[3] * 涌现苗头会随着数据规模增加而愈发明显[4] 2.7 行业落地场景 * 当前行业仍处于通用基础能力构建阶段,训练并未深度绑定特定场景[1][16] * 落地场景优先看好任务难度较低的物流分拣(如包裹翻转操作)[1][16] * 小米CyberDog 2在工厂执行简单任务可视为通过专用模型实现,针对特定、精细度要求不高的任务进行专门训练[17] * 对于更精细、更复杂的任务,行业内的模型还普遍无法胜任[17] 三、其他重要但可能被忽略的内容 3.1 数据基础设施挑战 * 拥有一百万小时原始数据不代表能直接用于训练,数据需经过清洗、对齐、管理和格式转换[8] * 视频数据质量清洗、画面对齐(单目与双目、头部与手腕视角)对数据管线要求极高[8] * 图片和视频流数据规模化后管理成本急剧增加,单张图片信息量远超文本[8] 3.2 数据采集标准与长期价值 * 数据采集与标注标准尚未统一,核心问题包括输出素材是否需与机器人本体绑定、动作标注精细度标准[10] * Ego数据缺乏接触任务(contact-rich tasks)中的真值信息,接触点标注是具身智能领域最困难的部分[10] * 行业涌现出各类数据手套(基于惯导或EMF的Manus、光学捕捉方案)用于捕捉人手关节动态[10] * 新型数据手套开始关注并集成手指与物体接触时的触觉信息及关节数据[10] * 2026年采集的数据在三五年后是否依然有效,取决于数据采集标准的确立和对数据未来价值的判断[10] 3.3 国内公司业务侧重 * 国内公司业务侧重分阶段演进:早期关注本体研发制造,中期重心转移到数据素材积累,后期核心竞争力放在模型研发[12] * 智元机器人、宇树科技等公司拥有自己的本体和数据素材,预计未来将更多资源投入到模型开发[12] * 从本体角度看,市场仍有巨大发展空间,头部宇树或智元人形机器人年出货量低于一万台[8] 3.4 行业关键转折点 * 首个基于千万小时级别数据训练出的模型效果是关键观察点[13] * 行业内已出现基于50万小时数据训练的模型(Figure 01)和百万小时级别成果(Covariant)[13] * 若千万小时量级模型能力相比百万小时级别有显著提升,意味着当前技术路径正确[13] * 一旦路径得到确认,所有资源将会迅速涌入,推动行业发展曲线以超预期陡峭程度加速攀升[13] 3.5 数据采集人力成本 * 千万小时Ego数据收集不完全依赖机器人本体,但综合成本依然非常高[15] * 关键是需要大量人力执行数据采集和维护工作[15] * 将人力开支等因素考虑在内,成本规模至少可以对标外卖配送行业级别[15] 3.6 行业评测体系缺失 * 具身智能领域公认的评测体系仍处于早期,多依赖仿真环境[7] * 仿真与真实世界存在巨大差距,导致现有评测体系难以准确反映模型真实能力[7] * 行业内评测标准不一,导致许多机构可宣称自己是"世界第一",评测体系失去应有意义[7] 3.7 数据格式与行业成熟度 * 整个行业仍处于非常初期的摸索阶段,数据格式尚未统一[9] * 具身智能领域无法直接套用大语言模型发展逻辑,后者启动训练时已有数十年积累的互联网数据可用[11] * 具身智能的数据积累才刚刚开始[11]