轮式机器人
搜索文档
墨奇智能黄青虬:做智驾五年,我知道具身创业该避开哪些噪音
晚点LatePost· 2026-08-19 19:02
公司核心观点 - 墨奇智能的目标是打造一台真正进入家庭、能够干活的通用机器人,但实现路径上不追求一步到位,而是先在酒店等真实商业场景形成闭环,再逐步扩展至通用场景 [4][15] - 后发公司(晚两年入场)的机会不在于重复先发者路径,而在于行业答案未定型时少走弯路、跑得更快 [6] - 公司创始人黄青虬认为,具身模型训练应增加多种“老师”(动作、语言推理、视频预测、深度估计、语义分割等),而非局限于VLA或世界模型单一方向 [8] - 墨奇采用“训练推理分离”策略:训练时让模型同时学习多种信号,部署时只保留执行动作所需部分,避免端侧算力限制模型学习能力 [9] - 公司强调“先闭环、再通用”,通过真实商业场景的产品使用、数据回流和模型迭代形成闭环,再逐步提升通用性 [15] 技术路线与模型策略 - 黄青虬认为VLA和世界模型不矛盾也不完整,只是答案的一部分,墨奇将不同训练信号作为“积木”服务于原生具身模型 [8] - 具身模型训练分为三个层次:从开源预训练模型出发做任务后训练;介入模型预训练;最终摆脱开源依赖训练原生具身模型,公司正在推进后两者 [8] - 具身模型与大语言模型相反:大语言模型是“小数据、大模型”,具身更接近“大数据、小模型”,因为端侧算力限制(机器人端侧可部署模型约3B到7B) [7] - 具身模型训练样本大小可能是大语言模型的数千倍,因为机器人面对连续视频、语言、触觉和本体状态等多模态输入 [8] - 墨奇不把VLA或世界模型当作最终架构,而是把不同训练信号作为“积木” [10] - 公司目前积累约3万小时数据已通过质检可进入模型训练,年内计划增加到15万至20万小时 [14] - 年内使用超2000张训练卡,加速数据训练闭环 [14] 数据策略与迭代效率 - 墨奇对数据设定三个条件:真实的人、真实的场景、干真实的活 [14] - 公司更看重真实工作产生的数据,而非单纯追求数据小时数,例如保洁人员擦桌子会观察污渍调整动作,而非重复规定轨迹 [14] - 数据闭环逻辑:机器人执行失败后,找出失败片段,从数据池检索相似场景,判断问题来源(数据覆盖、轨迹质量、模型或硬件),补充数据后重新训练 [13] - 如果问题主要通过调整数据解决,目前完成一轮迭代约需一周,未来希望缩短至一天;涉及模型结构或硬件修改时需一周到一个月 [13] - 黄青虬强调迭代效率:“如果你转一轮是一天,别人转一轮是五天,你就有别人五倍的迭代效率” [13] 产品与商业化路径 - 墨奇第一代产品采用轮式底盘,先绕开双足行走,集中精力在双臂操作,该款机器人将在8月中旬亮相 [17] - 公司称明年将实现千台级机器人交付 [17] - 灵巧手的自研优先级被暂时排在后面,因为测试发现人戴上夹爪能完成约70%任务,但机器人自主执行仅能完成3%至5%,瓶颈在模型而非手部灵活性 [17] - 酒店场景被选为早期切入点:房间工作接近家务,环境变化比工业场景多,数据易获得授权回传 [15] - 酒店工作被拆成160多个子任务,第一阶段主要是抓、拿、放(收垃圾、放矿泉水、换毛巾等),约占客房清洁工作量的30% [16] - 下一阶段处理床单、枕套等柔性物体,再往后需将单点动作串成长程任务 [16] 硬件策略与自研边界 - 墨奇划出硬件自研边界:只有当某个硬件阻碍模型迭代且供应商无法及时解决时,公司才考虑自研 [17] - 机器人关节属于自研范畴,因为算法团队发现同一指令下不同机器人机械臂可能停在不同位置,硬件不一致导致难以判断失败来源 [17] - 公司从肩关节开始自研,希望解决机器人执行动作偏慢和不同机器之间一致性问题 [18] - 黄青虬承认硬件迭代节奏慢于软件(硬件周期以周或月计,软件可按天或小时迭代),管理这种节奏差是产品能力的一部分 [18] 团队与融资背景 - 2025年底,黄青虬与高文礼共同成立墨奇智能 [4] - 半年内公司获得超过10亿元融资,团队扩张至150多人 [4] - 黄青虬此前在华为参与ADS 1.0到ADS 4.0开发,担任AI模型开发部部长,管理200多人,是华为智驾最年轻的技术管理者之一 [3] - 黄青虬在华为经历智驾从模块化、规则系统到AI驱动、端到端模型的多次切换,形成技术审美和快速验证迭代能力 [4] - 黄青虬在清华大学自动化专业就读期间参加机器人足球比赛,当时1.6米机器人能站立不倒即可进入前八 [4] 行业竞争格局 - 到今年,一批更早成立的具身智能公司估值已突破200亿元,人才、资金和产业资源加速向头部聚集 [3] - 行业至今未形成公认的技术架构,不同公司技术重点不同(Physical Intelligence、Figure偏VLA路线,World Labs强调世界模型和空间智能) [7] - Physical Intelligence已在模型训练中混合机器人图像、语言、高层语义任务和动作等多类数据 [9] - World Labs尝试把世界模型、仿真和真实世界学习放进同一体系 [9] - 具身行业远未形成稳定的技术和商业答案,后发公司机会窗口尚未关闭 [18]