AI系列深度20期:如何看物理场景中数字AI的能力边界?
东吴证券·2026-08-07 12:56

报告行业投资评级 - 行业投资评级为“增持(维持)” [1] 报告核心观点 - 数字AI与物理AI的发展关系可概括为“承接—分化—融合”,是长期协同演进而非先后替代 [4] - 伴随AI应用场景由信息空间走向物理世界,数字AI的理解与规划能力将同物理AI的感知、动作与安全闭环在同一系统中协同放大 [4] - 物理AI将成为物理世界的AI解决方案,在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景应重点关注 [4] 根据相关目录分别进行总结 1. 数字AI与物理AI:沿物理闭环程度形成连续谱 - AI应用场景可按照AI技术与场景的适配程度形成一条连续谱,一端是纯信息空间,另一端是真实物理世界 [9] - 判断场景位置的关键在于任务是否需要在真实物理世界完成“感知—决策—动作—反馈”闭环,以及闭环对实时性与安全性的要求 [4] - 越靠近纯信息空间,任务越依赖语义理解、知识与生成;越靠近真实物理世界,任务越依赖实时感知、三维空间理解、动力学预测、接触控制与安全闭环 [9] - 随物理闭环加深,数字AI单独完成闭环的充分性总体下降,物理AI专用技术栈的必要性总体上升 [9] - 报告选取典型应用场景按物理闭环程度由低到高归纳为八档:内容生成与信息处理、专业知识工作、企业流程与软件Agent、物理世界数据理解、物理资产调度与优化、结构化工业/仓储机器人、智能驾驶、通用具身智能/家庭机器人 [10] - 第1至第3场景主要发生在信息空间或软件系统内部,数字AI单独完成闭环的充分性由极高降至高 [10] - 第4、第5场景处于连续谱中段,任务需要理解物理世界的数据或约束,但行动多通过软件系统或调度完成 [10] - 第6至第8场景进入真实物理执行,需要感知、规划、动作控制和安全验证,物理AI专用技术栈的必要性由中高升至极高 [10] - 通用具身智能与家庭机器人因环境开放、任务多变、接触复杂和安全约束高,是数字AI难以单独完成闭环的场景 [10] - 从低物理闭环进入高物理闭环,是大模型能力外溢的重要方向 [11] - 在连续谱靠近信息空间的一端,数字AI可以快速渗透,其擅长的理解、生成、推理与工具调用构成完成任务所需的主要能力 [11] - 当任务越过连续谱中段进入自动驾驶、机器人、工业控制等场景时,需要智能体直接作用于物理世界,仅依靠语言和图像的语义理解不足以完成可靠闭环 [12] 2. 数字AI与物理AI的技术路径差距 - 核心差异在于作用对象与闭环要求不同,而非是否使用Transformer [14] - 数字AI主要面向信息空间,技术路径围绕大规模数字数据、Token化、Transformer基础模型、指令对齐和工具调用展开 [14] - 数字AI的主要目标是完成理解、生成、推理和软件执行,作用对象以符号化信息与软件状态为主 [14] - 物理AI面向真实或仿真的物理世界,技术路径围绕传感器输入、空间与本体状态表示、动作生成、规划、运动控制和反馈闭环展开 [15] - 物理AI的目标是在特定环境和安全约束下稳定行动,作用对象是物体、空间、动力学与接触关系 [15] - 数字AI主要处理语义、知识、逻辑与软件状态,预测对象可以是token、内容结果或工具执行状态 [16] - 物理AI需要学习空间、运动、动力学、接触关系和动作条件状态转移,输出表现为动作、轨迹、状态预测或动作后果 [16] - 数字AI的能力边界主要受事实可靠性、上下文管理、持续记忆和工具调用稳定性约束 [19] - 物理AI的能力边界主要受数据覆盖、物理长尾场景、实时控制、安全验证和Sim2Real迁移约束 [20] - 两类约束均难以依靠单纯扩大模型规模自动解决 [4] 3. 物理闭环越深,数字AI能力直接复用难度越高 - 迁移呈现三层结构:纯信息空间场景、近似物理世界场景、真实物理世界场景 [21] - 第一层纯信息空间场景,数字AI的理解、生成、推理与软件操作能力可直接完成主要任务 [21] - 第二层近似物理世界场景,视觉内容生成与多模态预训练高度同源,工程仿真则依赖物理引擎与场景建模 [21] - 第三层真实物理世界场景,语义理解与高层规划可迁移,状态维护、动作生成、实时控制和安全验证必须由专用技术补足 [21] - “看起来像世界”与“能被物理系统安全依赖”对应不同的能力门槛 [22] - 视觉生成能力可以构成物理AI的数据与模型基础,但不能直接等同于可部署的物理闭环能力 [22] - 数字任务通常更易通过检索、验证器、工具和人工复核降低错误影响 [22] - 物理任务除模型能力外,还受到动作数据、长尾场景、实时控制、Sim2Real和安全验证限制 [22] 4. 结论:物理AI将与数字AI协同演进 - 物理AI承接数字AI:Transformer架构、多模态表征与互联网图文视频先验构成物理AI的技术起点 [25] - 两者并行分化:物理AI需要自建本体对齐数据、仿真训练、实时控制与安全验证体系,不是数字AI的简单延长线 [25] - 数字AI在信息空间的深化不依赖物理闭环,两者将在各自主场长期并行 [25] - 两者有望融合于完整智能系统:LLM/VLM承担语义理解与高层任务分解,策略模型生成动作,世界模型和规划器预测状态转移并评估动作后果,控制系统完成真实执行 [26]

AI系列深度20期:如何看物理场景中数字AI的能力边界? - Reportify