华为追赶英伟达:把单卡之争变成一场集群战
虎嗅APP·2026-09-21 21:45

华为AI芯片战略与竞争格局分析 核心观点 - 华为的目标是成为英伟达,但并非简单复制,而是通过系统级创新(超节点、集群、互联)在单卡性能受制于制程的前提下构建竞争力 [4][29] - 华为的核心优势在于支持客户构建优秀大模型,确保各种大模型能在昇腾、鲲鹏、超节点及集群上高效运行 [4] - 华为已从英伟达在中国最大的客户之一转变为直接竞争者,其策略是“像蛇一样用长链条布局和迂回方式咬住对手” [8][18] 华为与英伟达的竞争历史 - 2020年之前,华为曾是英伟达在中国最大的客户之一,其Atlas平台服务器售价六七十万元,仅英伟达算力卡就占40万元 [8] - 2016年CES期间,华为海思总裁何庭波向英伟达CEO黄仁勋请求技术授权被拒,回国后接触寒武纪但最终决定自研 [8] - 2017年,代号“达芬奇”的内部AI芯片预研究项目正式立项 [8] - 华为选择DSA(面向特定领域优化的专用架构)路线,而非英伟达的CMP(多芯粒异构封装)路线,将计算单元改造成三维立体方块阵列,提升每瓦功耗的AI算力 [9][10] - 2018年上半年,自研昇腾芯片项目正式启动,主要瞄准数据中心推理卡和边缘计算 [10] - 华为曾向英伟达申请CUDA层授权被拒,随后决定不比拼单卡参数,而是转向“一台机器、一个机架、一个集群、一个规模化数据中心”的系统级打法 [10] 国产AI芯片竞争格局 - 2025年底至2026年初,摩尔线程、沐曦股份、壁仞科技、天数智芯四家国产GPU公司密集上市,燧原科技于2026年9月登陆科创板 [11] - 四小龙中,摩尔线程、沐曦、壁仞采用GPGPU路线兼容CUDA,燧原科技和华为昇腾一样选择DSA路线但不兼容CUDA [11] - 2024年,英伟达和华为海思占据中国智能计算芯片市场94.4%的份额,四小龙合计份额不到2%,华为昇腾是份额最大的国产厂商 [11] - 真正在系统级、集群级与英伟达正面交锋的,目前只有华为一家 [12] 昇腾960系列芯片性能与路线图 - 昇腾960DT面向训练,比原计划提前三个季度,2027年第一季度就绪;960PR面向推理,提前一个季度,2027年第三季度就绪 [16] - 后续970、980将保持一年一代的迭代节奏 [16] - 昇腾960DT核心算力和存储能力较上一代翻倍,性能高于英伟达2023年发布的H200 SXM,但低于2025年下半年开始发货的B300,单卡水平大致相当于英伟达两年前的产品 [16] - 华为通过服务器、集群等方式提升整机算力密度,代价是功耗更高 [18] - 2023年上半年,910B芯片回归,解决了此前架构性缺陷,推理芯片性能达到英伟达的1.6至1.7倍 [19] - 2026年初,华为高层明确昇腾战略意义,决定通过一体机业务解决中小算力场景,至此中国市场能稳定支撑上万个节点集群运行的AI芯片只有华为昇腾 [20] 超节点与集群架构 - 昇腾960超节点采用NPO技术,2027年上市,最多塞进4096张卡,算力达8 EFLOPS FP8、16 EFLOPS FP4,内存容量1PB [23] - 华为用5500个自研Hi-ONE光引擎替换4.8万颗800G光模块,功耗降低超过550千瓦,无故障运行时间翻倍,一年内非计划停机不到18小时 [23] - 灵衢UnifiedBus将十余种互联协议统一,带宽从百GB级冲到TB级,延迟从7微秒压到2微秒,全局内存统一编址 [23] - 多个超节点通过二层CLOS四平面组网,最大能拉到51.2万卡,多轨道拓扑理论上能干到100万卡 [23] - 华为马尔科夫实验室仿真数据显示,由4K超节点组成的10万卡集群,MFU(模型算力利用率)提升2.75倍 [24] - 目前业界10万卡集群的MFU普遍不足30%,约七成时间处于故障及故障修复状态,MFU每提升1个百分点,10万亿参数大模型的训练周期可缩短约3天 [24] - 2.75倍是仿真数据,尚未有百万卡级集群在实际生产训练中的验证数据公开,汪涛承认“100万卡只是技术指标,实际部署中10万卡可以基本满足需求” [24] 生态建设与迁移成本 - 华为轮值董事长徐直军力排众议,拍板开源MindSpore框架,后宣布CANN异构计算架构全面开源开放 [26] - CANN开源社区月活开发者突破5200名,非华为外部开发者占比61% [26] - 昇腾成为首个被PyTorch官网直接支持并提供安装分支的中国算力平台,基于昇腾+CANN的原生训练模型已超过40个 [26] - 对于DeepSeek这类开源模型,借助现有生态支持,通常只需额外增加2至3名工程师、耗时约一个月便可完成训练适配 [27] - 对于仅公开权重、不开放源码的商业模型,可能需要约10名工程师额外投入6个月以上 [27] - 中国AI产业国产替代呈现“推理先行、训练滞后”局面,华为推出“MindSpeed-LLM Agent”及自动调优工具,将跨版本适配工作从数天压缩至1小时 [27] 市场份额与战略差异 - Bernstein Research预测,2026年华为将占据中国AI芯片市场50%份额,英伟达份额将从2025年的约40%萎缩至8% [29] - TrendForce预测更激进,认为国产AI芯片在国内高端市场的份额将接近90% [29] - 英伟达CEO黄仁勋确认该公司在中国AI加速器市场的份额降至0%,并称放弃中国市场“在战略上并不合理” [29] - 英伟达走“硬件极致优化”路线,用全球最先进制程、最强大单卡和CUDA生态锁定全球市场 [29] - 华为走“系统创新突围”路线,在单卡性能受制于制程的前提下,用超节点架构、光互联技术、集群规模和开源生态构建竞争力 [29] - 华为明确7纳米是关键底线,昇腾950系列基于全栈自主可控制造工艺,转向功耗优化、面积优化、3D堆叠等方向 [30] - 何庭波提出“韬(τ)定律”,以时间微缩替代几何微缩,以系统性降低时间常数为终极目标 [30] - 华为宣布未来三年将再投入50亿元建设开源开放算力新生态 [30]

华为追赶英伟达:把单卡之争变成一场集群战 - Reportify