Workflow
大晓机器人
icon
搜索文档
专家回应“机器人大脑原地踏步”论:恰恰相反,它正进入最快演进通道
凤凰网财经· 2026-08-23 23:53
核心观点 - 具身智能的“大脑”能力并非停滞,而是已进入快速演进阶段,未来半年世界模型与具身智能逻辑将迎来显著突破[3][4] - 行业拉开差距的关键在于正确的研发范式与场景规模化落地双线竞赛[13] 大脑能力演进 - 数据采集已从传统实验室真机转向真实生产生活场景,量级积累正带动模型智能跃升[3][4] - 未来半年左右,世界模型与具身智能的实际逻辑将迎来显著突破,伴随长期产业化进程同步发生[4] 世界模型技术路线 - 未来三年两大关键方向:谁能率先拿到具备泛化能力的有效模型,谁就能占据先发优势;模型架构本身的创新将决定最终性能[5] - 大晓机器人提出“理解-生成-预测”一体化框架:理解指对物理世界的认知能力,生成是对未来世界演变状态的预测,三者结合才能实现具身智能的自我反思与自我规划[5] - 该模型结构处理效率比Cosmos快七十多倍,而许多方案仅基于开源视频生成模型加上控制模块,并非原生设计[5] - “理解-生成-预测”一体化正逐渐成为行业共识[5] - 通用具身智能理想状态:三种能力深度融合,模型像人一样对物理世界拥有直觉理解力,能自主规划、执行、反思,架构足够高效适应现实环境[6] 具身智能ChatGPT时刻 - 具身智能出现智能涌现需两个前提:第一是数据量,大晓目标到明年年底达到千万小时量级(去年行业整体约10万小时量级)[7] - 第二是模型,要通过世界模型从海量数据中真正学到物理规律和因果逻辑[7] - ChatGPT时刻只是新起点,大语言模型从2022年出现到产生较高生产力价值经历了三到四年持续演进,具身智能同样如此[7] 技术路线与场景选择 - VLA针对特定任务学习,偏模仿学习范式,对相对静态场景有一定应对能力[8] - 世界模型最大特点是能持续生成和预测未来状态,判断采取动作策略后几秒钟可能发生什么[8] - 家庭场景想象空间和市场空间最大,但环境不受控,对安全性和可靠性要求极高,近距离接触老人和孩子任何失误都可能带来伤害[9] - 隐私问题使远程监管难以在家庭中适用[10] - 大晓路径是先To B、后To C,先在可控的生产和服务场景持续验证,等软硬件成熟度、安全性和可靠性建立足够信心后,再逐步进入家庭[10] 落地场景选择特点 - 第一是可复制性:只有可复制才有机会规模化,把硬件成本摊薄,如即时零售运营方半年到一年左右能回本[11] - 第二是业务方向的上限:即时零售看似具体,里面却有几十项任务、不同难度等级,随着机器人能完成任务增多,可解锁业务范围不断扩大[11] - 第三是场景里的信息密度和智能密度:场景过于单一难以支撑通用泛化能力,即时零售和酒店任务种类丰富,且与未来家庭场景有较强关联[11] - 大晓重点推进零售、酒店、仓储、物流及部分工业场景,在这些可复制场景中验证技术和商业闭环[11] 开源策略 - 世界模型需要部署到机器人端侧且当前主要面向To B,完全闭源会使接触和使用的人较少,难以从社区获得足够反馈[12] - 大晓开源不只是开放模型参数,还会提供一整套让开源模型部署到机器人端侧GPU并接入运控的能力[12] - 有了较好基础模型,再叠加以人为中心的环境式素材和模型能力,面对新硬件型号或新任务时,后训练只需采集少量真机数据即可学习新任务[12] 行业竞争格局 - 具身智能的ChatGPT时刻尚未真正到来,谁能找到正确的研发范式、在快速迭代中率先实现智能涌现至关重要[13] - 去年很多具身智能公司对真实场景落地还比较谨慎,今天市场期待越来越聚焦于规模化和真实场景落地[13] - 谁能在模型能力提升和场景规模化铺开两个方向同时建立优势,谁就会有更大机会[13] - 物理AI核心在于把空间智能、物理属性、物体属性、空间记忆等物理智能,与大模型已具备的认知和推理能力结合[13] - 未来半年左右,当世界模型开始出现比较明显的智能涌现时,机器人执行过程中会看到更多“惊喜”,一些没有专门教过的东西也能通过基础能力和对世界的理解去完成[13] - 到明年,希望看到更强的场景泛化、新的技能涌现,同时可能有几千台机器人在即时零售、酒店等场景常态化运营[13]