人形机器人行业深度研究电话会议纪要 行业与公司 * 行业: 人形机器人 (Humanoid Robotics) [1] * 涉及公司: Physical Intelligence (私人公司) [5][20], Figure AI [35], Nvidia [35], Google [35], Dyna Robotics [35], Rhoda AI [35], Agibot [35], Galbot [35], Robotera [35], PaXini [36], Tashan Technology [36], Tesla (Optimus) [37], Boston Dynamics [37], Agility [37], Unitree [37], LimX [37], Cognex [39], HDSI [39], Inovance [39], Estun [39], Fanuc [39], Keyence [39], Hesai [39], Leader Drive [39], Tuopu [39], Sanhua [39], Shuanghuan [39] 核心观点与论据 机器人“大脑”模型 (Brain Model) 的演进 * 世界模型 (World Model) 成为新范式: 机器人“大脑”模型的最新突破是获得了“想象”能力 传统VLA (视觉-语言-动作) 模型是线性指令到动作的转换 而世界模型范式则能预想动作的结果 公司认为这是正确的前进方向 [2] * VLA与世界模型的融合: 宣称“VLA已死 世界模型万岁”的说法具有误导性 真正的路径是两者的融合 例如Physical Intelligence的π0.7模型 其核心是模型“想象”结果的能力 而非名称标签 [2] * 世界动作模型 (WAM) 的预测: 未来三年 世界模型 特别是能同时想象动作及其对环境影响的“世界动作模型 (WAM)” 将被广泛采用 用于实现长时域自主性和跨任务、跨本体的泛化 [3] * 物理理解的挑战: 过去两年的重要研究结论是“视觉真实不等于物理正确” 在全面的“物理理解”评估中 2026年最好的世界模型仅得分22% 这一挑战在未来三年可能依然存在 [3] * 记忆功能的注入: 机器人目前几乎没有记忆功能 无法根据失败原因调整动作或跟踪长时任务进度 注入记忆功能是研究新前沿 预计将是下一个重大突破 [5] * 多模态数据融合: 非视频的物理数据是机器人技术区别于其他AI应用的独特挑战 目前物理数据的种类仍然非常有限 模型也难以有效利用扩展的数据模态 未来三年 机器人“大脑”将更擅长融合第三方/自我中心/手掌视频、人类与机器人动作、力觉和触觉传感数据 [6][8] 数据与训练技术 (Data & Training Technique) - “AlphaGo时刻” * 强化学习 (RL) 是关键: 机器人模型训练目前处于“前AlphaGo”阶段 通过大量数据学习匹配人类行为 但性能会停滞 强化学习 (RL) 已成功解决机器人运动问题 但在操作任务上进展有限 主要难点在于为复杂任务开发有效的奖励函数 [11][12][13] * “ChatGPT时刻” vs “AlphaGo时刻”: 公司认为机器人领域不应追求“ChatGPT时刻” 而应拥抱“AlphaGo时刻” 即解决操作任务的强化学习问题 将大多数任务的成功率从60%高效提升至99% 预计距离重要突破还有几年 当前机器人操作训练水平相当于2012年的围棋算法 [14] * 数据被高估: 数据至关重要 但也被高估 [15] * 预训练数据“供过于求”: 模型进步已极大扩展了可用数据范围 慢速昂贵的遥操作正被互联网视频、自我/手腕摄像头和UMI (通用操作界面) 补充甚至取代 预训练数据“供过于求”的说法略有夸张 但已不远 [16] * 后训练/部署数据的真正挑战: 后训练数据确实稀缺 但“数据飞轮” (更多部署→更多数据→更好性能) 的流行观点完全忽略了重点 主要挑战不是数据量 而是数据与任务性能之间的断裂链接 这需要强化学习的突破 [16] * 数据需求减少的轨迹: AlphaGo Zero 以100:0击败AlphaGo 且完全通过自我对弈训练 无需任何专家数据 AlphaZero进一步泛化 零数据学习多种游戏 这展示了算法和训练技术的进步大幅减少了对数据的需求 [17] * 触觉传感数据将持续稀缺: 某些类型的数据 如触觉传感 需求会更高 并持续成为稀缺资源 [18] * 模型-数据集成开发是护城河: 不同模型对数据的选择性不同 只有约10%的收集数据可用 最有效的方式是根据模型特性定制数据收集 公司预测 模型-数据集成开发 (如Physical Intelligence的做法) 将成为可持续的护城河 [19] 产品与商业化 (Products) - “跨越卢比孔河” * 2.5年投资回收期门槛: 2026年人形机器人的焦点正从运动演示转向商业应用 仓库拣选、工厂物料搬运、巡逻和最后一公里配送等应用的投资回收期很快将低于2.5年 这四项应用约占公司预测的2031年100万台年出货量的一半 [21] * 成本下降驱动: 回收期缩短主要由机器人价格下降驱动 而价格下降是产量增加的结果 经验证据显示 当产量翻倍时 成本通常下降15-18% 在极小产量时下降曲线更陡峭 [21] * 跨越卢比孔河: 对于工业和商业企业 跨越2.5年投资回收期就像跨越卢比孔河 之后采用将决定性地加速 大型企业可容忍长达5年的回收期 而动态行业的小公司希望回收期短至1年 [22] * 平台硬件与杀手级SKU: 行业正经历SKU的爆炸式增长 公司预测这一趋势将继续 同时会出现少数平台机器人产品 未来三年行业不太可能出现整合 但销量会集中在一些杀手级SKU上 这些SKU的设计将针对工厂和仓库的物料搬运进行优化 每只手臂可持续负载10-15公斤 [23] * 平台硬件的优势: 成为平台硬件将带来巨大好处 包括采购和生产的规模经济 模型开发者也可能围绕这些平台硬件进行模型设计和训练 从而形成良性循环 实现这一地位的关键因素是销量 (通过商业成功) 和一致性/可靠性 (通过硬件设计和制造专有技术) [26] 行业生态 (Industry) - “拼图中缺失的一块” * 技能层 (Skills Layer) 需要独立发展: 机器人“技能” (如分拣包裹、装载洗碗机) 常与“大脑”模型混淆 但两者有本质区别 大多数技能并非大脑模型的一部分 而是模型能够学习的内容 行业要规模化 技能层需要独立发展 因为最终会有几个大脑模型、几十家机器人制造商、数百个SKU 但成千上万个应用场景 [27][28][29][30] * 系统集成商是缺失的拼图: 在工业机器人领域 技能层主要由系统集成商构成 在人形机器人领域 “系统集成商”是最后一块缺失的拼图 预计未来几年将出现 部分解放机器人制造商和模型开发者的部署、数据收集和后训练负担 一旦开始 这将是一个长达数十年的旅程 [30] 其他重要内容 赢家选择 (Picking Winners) * 大脑模型赢家: 下一代大脑模型的三个预测方向都指向Physical Intelligence 其他值得关注的“大脑”来自Figure AI、Nvidia和Google 两家早期初创公司Dyna Robotics和Rhoda AI因展示首个机器人“规模定律”和使用世界模型转移数据负担而受到关注 在中国 Agibot、Galbot和Robotera是冉冉升起的新星 [35] * 数据领域机会: 数据稀缺与数据过剩并存 最新的UMI热潮可能不可持续 触觉传感是更确定的机会 技术路径多样 下注单一路径为时过早 PaXini和Tashan Technology是公司密切关注的两家公司 [36] * 机器人本体赢家: 成为行业平台产品的竞赛尚无明确领跑者 特斯拉的Optimus在硬件设计和一致性方面可能具有优势 (得益于其供应链和制造能力) 但在模型、数据/训练技术等其他重要技术上似乎落后 有希望的竞争者包括Boston Dynamics、Figure AI、Agility、Unitree、Agibot、LimX等 最重要的新观察指标是系统集成商围绕某些机器人制造商聚集的早期证据 [37] 伯恩斯坦股票列表 (Bernstein Ticker Table) * 评级与目标价: 报告列出了多家公司的评级、目标价和市盈率数据 包括Cognex (评级O 目标价85.00美元)、HDSI (评级O 目标价7,800.00日元)、Inovance (评级O 目标价82.00人民币)、Fanuc (评级O 目标价7,200.00日元)、Keyence (评级O 目标价95,000.00日元)、Hesai (评级O 目标价29.00美元)、Leader Drive (评级U 目标价115.00人民币)、Tuopu (评级O 目标价75.00人民币)、Sanhua (评级M 目标价39.00人民币)、Shuanghuan (评级O 目标价60.00人民币) 等 [39]
人形机器人-“皇帝的新大脑”与AlphaGo时刻:塑造未来三年的四大预测-Humanoid Robotics_ The emperor‘s new brain and the AlphaGo moment - four predictions shaping the next three years