机器人系列深度之39:从发散到收敛,具身模型和数据体系的产业演进

报告行业投资评级 - 报告未明确给出行业投资评级 报告的核心观点 - 机器人产业发展的四大关键要素为模型、数据、本体和场景,当前阶段模型和数据是行业最大的瓶颈[3] - 模型架构尚未收敛,但相似度较高,多为VLA、扩散模型、世界模型等的融合架构,大脑推理和小脑动作模型分层[3] - 数据是模型训练的核心燃料,关键在于数据数量、质量和scale-up,具身智能天然缺乏机器人轨迹数据[3] - 人形机器人进入具身智能驱动的新阶段,中长期建议沿三条主线布局:人形机器人核心零部件厂商、具身模型和本体厂商、机器人数据采集硬件与数据服务相关标的[3] 机器人产业发展的四大关键要素 - 模型是机器人大脑,负责推理决策,决定了机器人智能化水平的上限[5] - 数据是模型训练的燃料,没有高质量数据,模型无法进行有效训练[5] - 本体是机器人物理载体,执行能力的物理上限,所有智能指令最后依靠本体执行[5] - 场景是商业化落地的重点和机器人的需求来源,决定了机器人的任务边界,机器人必须有场景才能产生价值[5] 具身模型:负责决策的核心大脑 机器人模型迭代历程 - 阶段一:经典控制模型时代(1960–2010),基于数学建模,局限性是需要精确CAD参数,无法自主理解环境[8][11] - 阶段二:数据驱动模型萌芽(2010–2018),机器学习补充动力学,感知接入,局限性是感知服务于运动控制[9][11] - 阶段三:大语言模型诞生(2018–2022),机器人认知模型启蒙,LLM作为规划大脑,局限性是LLM只懂文本,没有空间几何感知[10][11] - 阶段四:多模态具身基础模型时代(2022年至今),视觉+语言+动作统一模型,局限性是泛化能力较差,仿真到现实迁移难度大[12][15] - 阶段五:世界模型(下一代,演进中),机器人能预测执行动作之后环境会发生什么,具备自我进化和自我学习能力[13] 当前具身模型玩家 - 科技大厂:谷歌、字节、腾讯、阿里等[16] - 具身模型&本体公司:PI、Figure、智元、星海图等[16] - 大语言模型厂商:OpenAI等[16] 主要公司模型迭代 Physical Intelligence (PI) - 2024年10月发布π0模型,首提VLM+流匹配动作专用模块架构,输出连续高频率动作[18][20] - 2025年1月推出FAST动作分词技术,训练速度提升5倍[18] - 2025年4月推出π0.5,实现开放世界泛化,陌生环境直接作业[18] - 2025年11月推出π0.6,开箱即用无需微调即可落地,并引入强化学习RECAP[18] - 2026年3月引入MEM长短时记忆,支持15分钟长任务,引入RL Tokens快速提升精细操作阶段[18] - 2026年4月发布π0.7,引入多元化数据、数据打分机制、世界模型,实现组合式泛化能力[18][27] - π0.7模型架构为VLA+流匹配,高层策略网络基于SigLIP (400M) + Gemma (4B),世界模型基于BAGEL (14B),Action Expert为860M[32] - π0.7性能:兼容次优异构数据,实现技能组合泛化,单模型零样本达到专精RL模型灵巧操作水平[33] Google DeepMind - 2022年发布RT-1,基于经典Transformer结构方案,从机器人相机获取图像历史记录和自然语言任务描述作为输入[34] - 2023年7月发布RT-2,首次提出VLA模型,将视觉输入、语言推理与动作输出端到端融合,把连续动作离散成token做分类自回归[38][40] - 2023年发布RT-X,通过大规模多样化数据集Open X-Embodiment训练,数据集由全球21家机构合作,涵盖22种不同机器人类型,包含超过100万个片段,展示500多项技能和150000项任务上的表现[36] - 2025年9月发布Gemini Robotics 1.5系列,通过两个模型协同工作:协调器Gemini Robotics-ER 1.5和动作模型Gemini Robotics 1.5[37][41] - Gemini Robotics 1.5实现运动迁移,能从不同形态机器人数据中学习无需额外训练,多形态数据提升性能[44] - Gemini Robotics 1.5实现思考再行动的VLA,在执行动作前生成思考轨迹和具体动作步骤,提升多步骤任务成功率[45] - 2026年7月发布Gemini Robotics 2,包括VLA模型、具身推理模型ER 2和端侧轻量化模型On-Device 2[47][48] - Gemini Robotics 2实现跨本体迁移只需几个小时,高级灵巧度能完成拧灯泡和打结等精细动作,全身控制从脚到指尖[48] 阿里 - 2026年5月发布Qwen-VLA,基于Qwen多模态骨干模型,将视觉感知、语言理解和空间推理能力扩展到连续动作生成和轨迹预测[56][57] - Qwen-VLA采用四阶段训练:T2A文本到动作预训练、CPT预训练、SFT监督微调、RL强化学习[59] - 2026年6月发布Qwen-Robot Suite,包含三个基础模型:Qwen-RobotNav、Qwen-RobotManip与Qwen-RobotWorld[52] - Qwen-RobotNav在1560万条样本上训练,一套权重统一五类导航任务[54] - Qwen-RobotManip以Qwen3.5-4B VL为骨干,结合流匹配DiT动作头[53] - Qwen-RobotWorld将20余种机器人本体纳入同一世界模型联合训练[52] 字节跳动 - 模型架构为VLM+动作,GR-3为VLA模型[61][62] - GR-RL是基于VLA策略面向长周期灵巧操作任务的机器人学习框架,采用多阶段训练流程实现系鞋带任务中长期、灵巧且高精度的操作控制[62] 智元 - 2025年3月发布Genie Operator-1 (GO-1),架构由VLM + MoE组成[65][67] - VLM借助海量互联网图文数据获得通用场景感知和语言理解能力,MoE中的Latent Planner借助大量跨本体和人类操作视频数据获得通用动作理解能力[67] - 2024年底推出AgiBot World,包含超过100万条轨迹、涵盖217个任务、涉及五大场景的大规模高质量真机数据集[67] - 2026年发布Go-2模型[67] 银河通用 - 2026年4月发布LDA-1B模型,1.6B参数一体化机器人基础模型(世界模型)[69] - 数据来源包括高质量动作数据、次优/含噪声动作数据、无动作视频,共3万+小时异构数据[69] - 核心模型为LDA-1B(Multi-Modal Diffusion Transformer,MM-DiT),三大目标:Policy输出机器人动作、Dynamics学习物理交互和物体运动规律、Visual Forecasting预测未来画面[70] 星海图 - 2025年8月发布VLA模型G0,2026年6月发布最新模型G0.5[72] - G0.5架构创新:采用统一自回归VLA架构,单一Decoder Transformer主干,视觉、语言、任务推理、动作生成全部统一到自回归框架[75] - 三大核心能力:统一异构动作编解码器、原生动作思维链、时空注意力模块[75] 腾讯 - 发布Hy-Embodied-RxBrain(联合文本推理+视觉想象的独立世界模型)和Hy-Embodied-0.5-VLA(执行端模型)[76][81] - Hy-Embodied-RxBrain采用Modality-routed Mixture-of-Transformers (MoT)架构,单模型同时支持文本、图像、视频的理解和生成[78] - Hy-Embodied-0.5-VLA提出通用机器人学习全栈体系,包括数据采集、模型结构、预训练+监督微调、离线强化学习后训练、真机部署[82] Generalist AI - 2025年11月发布GEN-0模型,基于27万小时真实世界操控交互数据[88] - 实证机器人具身基础模型存在Scaling Law,随着真实物理交互数据规模提升,模型泛化能力持续可预测提升[88] - 2026年4月发布GEN-1模型,基于超50万小时高保真物理交互预训练数据集[88] - GEN-1实测结果:同类任务平均成功率从64%提升至99%,执行速度提高三倍,每个目标任务仅需1小时真实机器人采集数据[88] 宇树科技 - 2025年发布预测式世界模型UnifoLM-WMA-0,具有仿真引擎和策略增强两大功能[90] - 2026年1月发布VLA模型UnifoLM-VLA-0,基于开源Qwen2.5-VL-7B骨干网,使用340小时的开源真实机器人数据集进行预训练[90] - 开发基于G1的12类任务的机器人数据集,模型能够可靠地通过单一策略检查点完成全部12项任务[90] 模型架构路线 - 路线1:VLM主干→独立动作生成头,是当前最主流模型架构,代表有PI π0.7、阿里Qwen-VLA、字节GR-3、智元Go-1等,优势是工程友好、训练稳定、易微调[95] - 路线2:分层快慢脑架构,上层模型负责高层任务推理规划,下层动作模型负责动作输出,代表有Gemini Robotics 1.5,优势是兼顾大模型推理能力与底层实时控制性能[92] - 路线3:一体化自回归序列模型,把图像+文本+动作Token放入同一个自回归Transformer,代表有星海图G0.5、Google RT-2,优势是统一范式结构简单[93] - 路线4:一体化扩散/世界模型,代表有银河通用LDA-1B,优势是天然具备具身认知和环境预判,理论上限最高[94] 数据采集:模型训练的关键燃料 数据来源 - 互联网数据:提供物理常识、视觉和语言泛化能力、长序列任务的语义逻辑[99] - 真实数据采集:包括主从机械臂式遥操作、VR/AR操作、外骨骼和人体动捕[100][101][102] - Ego数据(第一人称视角数据):优势在于低成本、规模化、脱离机器人硬件、天然包含人类注意力机制[112] - Ego4D数据集包含3670小时的日常活动视频,覆盖数百种场景[112] - 英伟达EgoScale使用20,854小时的人类第一人称视角视频进行预训练[113] - UMI数据(Universal Manipulation Interface):核心是用手持夹爪+腕部视角相机,采集与机器人末端同构的观测和动作数据[122] - 仿真合成数据:依托物理仿真引擎在虚拟环境中自动生成结构化数据,潜在数据规模极大、边际成本低[126] 数据路线选择 - 不同公司押注不同的数据路线,普遍采用多种数据类型、开源+内部数据集融合的方式[128] - 真机遥操作数据仍是价值量最高的数据资产[128] - Ego数据凭借成本和规模化优势,已逐渐成为重要补充[128] - 以模型为投入中心的科技大厂,更侧重能够scale up的数据,例如英伟达主推仿真[128] 数据采集环节的投资机会 - 硬件:遥操作套件(Stanford ALOHA、UMI方案)、传感器(视觉传感器、力矩传感器、IMU和触觉传感器)[129][131] - 软件与算法层:物理仿真引擎、场景重建与运动学重定向[130] - 数据集提供商和服务商:机器人数据采集与评测外包服务商、垂直领域物理数据公司[131] 相关标的梳理 - 人形机器人进入具身智能驱动的新阶段,投资机会分布于本体、模型、数据三大链条[135] - 中长期建议沿三条主线布局:人形机器人核心零部件厂商、具身模型和本体厂商、机器人数据采集硬件与数据服务相关标的[135] - 重点公司包括:上纬新材(本体)、奥比中光(视觉传感器+数采)、华依科技(IMU数采)、索辰科技(仿真软件)、凌云光(光学动捕)、风语筑(数据采集)、智谱(具身模型)、优必选(本体+模型)、越疆(本体)、卧安机器人(本体+模型)、极智嘉-W(本体+数据)、群核科技(仿真合成平台)、五一视界(仿真合成平台)[136]

机器人系列深度之39:从发散到收敛,具身模型和数据体系的产业演进 - Reportify