Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代”

核心观点 - Arm发布新一代移动计算平台CSS for Mobile 2,核心方向转向Agentic AI和AI原生图形,认为未来AI手机竞争不再是比较单一计算单元的TOPS,而是CPU、GPU、专用加速器、内存和软件能否真正协同[2][3] AI成为移动设备运行层 - Arm认为AI正在成为移动设备的运行层,过去AI是独立功能,生成式AI停留在“问-答”模式,而Agentic AI是“Goal-focused”,需要连续完成感知、记忆、推理、行动四个阶段[4][5] - Agentic AI工作负载具有对延迟敏感、突发性、内存密集、高度异构四个特点,CPU被定位为AI智能体的Orchestrator(编排者),搭载SME2的CPU负责轻量级AI、工具调用和系统编排[6][8] - 高规格移动NPU可达约100至200 TOPS,而搭载SME引擎的CPU集群等效算力约5至6 TOPS,CPU适合小而碎、对响应速度敏感且需要高度通用性的AI任务[8][9] C2 CPU集群升级 - C2 CPU集群相较上一代,GeekBench 6.3单线程性能提升15%,多线程提升12%,Web浏览性能提升15%,应用启动速度提升12%[10] - 搭载两个SME2核心的C2平台在Arm测试的最新AI模型中最高可实现1.7倍性能提升[10] - 在智能体流程细粒度测试中,C2-Ultra相较C1-Ultra在语音转文字阶段快约40%,多语言个人记忆检索快约41%,小语言模型生成结构化Prompt平均快约25%[12] - SME2和LUTi两项能力分别提高Prompt Encoding阶段MAC运算数量和针对Decode阶段查表类工作降低内存带宽需求[12] SI L2系统互连 - Arm发布新的SI L2系统互连,针对Agentic AI系统级挑战增加硬件一致性机制、QoS、高带宽统一内存访问、安全机制,原生支持LPDDR6[14] - 相较SI L1,SI L2可将CPU访问DRAM的延迟降低约45%,同时兼容LPDDR5和LPDDR5X[14] - CSS for Mobile 2旨在优化完整路径:Orchestration → Compute → Memory Movement → Software → Tools[15] GPU的AI原生图形技术 - Arm将新一代Mali G2-Ultra NX称为第一颗“AI-native Mali GPU”,思路变为有选择的渲染,然后利用AI重建细节、帧和光照[16][19] - Mali G2-Ultra NX加入专门神经网络加速器NX,提供三项主要神经图形技术[19] - 神经超级采样(NSS)可将540p画面重建至1080p,部分场景持续帧率接近2倍,外部内存流量降低约50%[21] - 神经帧率提升(NFRU)可将持续60 FPS提高至120 FPS,DRAM流量降低33%[24] - 神经超级采样与降噪(NSSD)将超分与光追降噪结合,让GPU用更少光线追踪样本生成最终画面[26] - 最终画面中最多7/8的像素可由AI重建,真正原生渲染的像素只剩1/8[28] - 在《光影新生(Neural Dawn)》案例中,G2-Ultra NX将约15 FPS画面提升至可持续运行的60 FPS,相较上一代最高实现4倍帧率提升、4倍能效提升,DRAM数据流量降低最高70%[30] - G2-Ultra NX加入新的Execution Engine和第三代Ray Tracing Unit,新执行引擎是Mali GPU七代以来最大ISA重构[31] - 第三代光追单元采用更紧凑三角形数据结构,可将领先光追Benchmark的DRAM流量降低最高13%,结合硬件Opacity Micromaps后特定场景光追GPU工作负载最高减少70%,帧率提升最高30%[32] - NX支持INT8和INT16运算,可运行Whole Tensor Operations和压缩权重,配套Motion Engine完成光流加速,能复用GPU原有Memory System、Control Structure和一致性缓存[33] NPU定位与分工 - Arm几乎未将自研NPU作为CSS for Mobile 2重点,认为NPU适合大型、高计算密度模型,但更愿意将NPU差异化创新交给SoC合作伙伴[34] - CPU和GPU拥有通用性优势,对于大量第三方开发者而言不同NPU适配成本高,端侧AI算力分工进一步细化:NPU追求极致专用AI效率,GPU承担大规模并行和AI计算,CPU负责低延迟AI、控制、工具调用及系统编排[34] 软件生态与工具 - Arm推出AI Portal,提供已针对Arm优化的模型、可直接部署的示例应用及模型优化工具,帮助开发者完成从模型发现到最终部署的流程[35] - KleidiAI已拥有超过100个第三方应用集成、12个以上AI框架集成以及200多个优化Microkernel,代码量超过14万行[38] - 神经图形领域采用开放模式,NSS、NFRU模型可公开获取和调整,提供SDK及游戏引擎插件,将神经图形加入现有游戏约需3至6个月,新游戏开发到出货可控制在18个月以内[38]

Arm重构移动计算:CPU编排智能体,GPU踏入“AI像素重建时代” - Reportify