Workflow
人工智能算力集群
icon
搜索文档
华为全联接2026解读
2026-09-21 22:47
华为升腾960系列及NPO技术演进电话会议纪要关键要点 一、涉及的行业与公司 - **行业**:AI算力芯片、光通信、半导体设备与封装测试 - **公司**:华为(海思)、NVIDIA、阿里、腾讯、Mellanox、Coherent、Marvell 二、核心观点与论据 1. 升腾960系列芯片性能与上市时间 - 升腾960DT(训练)预计2027年Q1上市,较原计划提前三个季度[2] - 升腾960PR(推理)预计2027年Q3上市[2] - 960DT的FP8和FP4算力较950DT翻倍[2] - 960PR的FP8算力与前代持平,FP4算力翻倍至8 PFLOPS,是950DT的四倍[2] - 960DT的HBM容量达288GB,带宽9.6 TB/s,分别是950DT的两倍和两倍多[2] - 960DT采用8颗HBM,单颗容量36GB,带宽1.2 TB/s,性能介于HBM3E与HBM4之间[2] - 960PR的HBM容量192GB,带宽2.4 TB/s,单颗容量16GB,带宽200 GB/s,性能略优于HBM2E[2] - 960DT和960PR互联带宽均为2.2 GB/s,高于NVIDIA B200/B300的1.8 GB/s[2] 2. 升腾970/980性能规划与超晶粒技术 - 升腾970预计2028年上市,FP8算力3.6 PFLOPS,FP4算力14 PFLOPS,对标NVIDIA B300[3] - 升腾980预计2029年发布,FP8和FP4算力再次翻倍,分别达7.2 PFLOPS和28 PFLOPS[3] - 升腾970和980均基于“超晶粒”技术打造[3] - 鲲鹏960 CPU(2028年Q1上市)采用两层逻辑芯片堆叠,鲲鹏970采用三层逻辑堆叠[3] - 消费端Mate X D two已首发搭载三折叠形态的9,050 Pro手机端“超晶粒”芯片[3] 3. 960超级节点集群配置与架构 - 1,024卡规模集群配置1,024个GPU和256个CPU,采用独立液冷机柜[4] - 集群使用1,312颗交换芯片,包括1,280颗一级和32颗二级交换芯片[4] - 每个机柜增加8颗一级交换芯片(从72颗增至80颗)用于连接冗余[4][5] - 使用超过4万米光纤和超过19万根铜线,柜内用铜线、柜间用800G光模块[5] - 整体架构以升腾总线为基础,连接GPU、CPU和存储超级节点[5] - 鲲鹏950 CPU超级节点最大支持4,096个节点组网[5] - OceanStor A900液冷存储节点单集群提供64PB存储容量和400GB/s聚合带宽[5] 4. 960超级节点连接方式变化 - 960超级节点将GPU和CPU集成在同一刀片,每个刀片含8个GPU和2个CPU(4:1比例)[7] - 950超级节点中NPU和CPU分开部署[7] - 960超级节点首次采用NPO(近封装光学)技术进行连接[7] 5. NPO技术优势与行业共识 - NPO通过Socket方式将光引擎连接在主芯片附近,缩短电信号传输距离,实现可拆卸可维护[8][9] - CPO集成度最高但良率、散热和可维护性挑战巨大[8] - NPO可复用相对成熟的光通信产业链,被认为是更容易规模化部署的方案[9] - 国内外在NPO技术路线上已形成较高共识,海外厂商自2026年Q2开始从CPO转向NPO[9] 6. 华为NPO布局与时间节点 - 2025年5月首次提及光互联,2025年9月海思介绍“Hi-One”NPO方案[10] - 2026年7月联合产业链发起Open NPO项目,2026年9月深圳光博会实物展示[10] - 4,096卡960超级节点系统使用约5,500个“Hi-One”NPO,替代约4.8万个800G LPO模块[10] - 带宽提升约8至9倍,系统功耗降低超过550千瓦,无故障运行时间提升一倍,可用度达99.8%[10] - 2027年Q2上市8,860风冷版本,2027年Q3推出960液冷版本[10] - 光引擎器件需在2027年Q1开始量产,快于市场预期的2027年下半年[10] 7. “Hi-One”NPO技术特点 - 采用基于氮化硅SOI的硅光平台,拥有36路单波200G通道[11] - 采用内置光源方案,激光器功率约100-150毫瓦,省去保偏光纤布线[11] - 主流外置光源方案需300-400毫瓦以上功率,保偏光纤产能有限且价格较高[11] - 内置光源面临高温温漂、稳定性及系统一致性挑战[11] - 单片集成超过2000个光学器件,通道数从传统8或10个提升至32个以上[13] - NPO方案通常不再使用DSP,信号补偿功能迁移到TIA和Driver等电芯片[13] 8. 产业主导权变化 - 传统光模块时代主导权在光模块厂商[13] - NPO时代主导权向系统厂商迁移,华为推出Open NPO标准,阿里和腾讯推出各自NPO标准[13] - 海外有Open CXL Consortium等标准,参与者包括Mellanox、Coherent和Marvell[13] 9. 未来驱动超级节点放量的应用场景 - AI应用商业化变现,推理算力需求持续增强[6] - 大语言模型持续投入,国内至少10家公司进行10T级别大模型迭代,每家公司需至少20万张AI卡,国内增量超200万张卡[6] - 政企市场智能化改造,从软件开发扩展到金融、医药等行业[6] - 智能驾驶领域,预计2027年L3级别自动驾驶牌照发放将大幅增加算力需求[6] - 计算智能,远期需求空间巨大[6] 三、其他重要但可能被忽略的内容 1. NPO产业链核心受益方向 - **高密度无源器件**:量价齐升,NPO光引擎通道数达32或36个,增加FAU、MT插芯、MPU、Isolator和透镜等需求[14] - 超算集群规模扩大增加系统层面高密度光连接需求[14] - NPO/CPO对耦合精度、插损和一致性要求远高于传统光模块,单个器件价值量显著提升,MT插芯和V-Groove价格已大幅上涨[14] - **高速电连接Socket**:引脚数可达300个左右,未来可能超过500个,包含高速电信号连接和供电功能[14] - 对电连接精度和性能要求比CPU中Socket方案更高,壁垒高于传统Socket[14] - **设备端**:预计2026年Q4出现放量迹象,NPO光引擎生产需贴片、键合、耦合、先进封装和测试设备[15] - NPO光引擎自身需通过2D或2.5D先进封装实现PRC和ERC封装,对具备光电合封工艺的先进封装厂商构成增量[15] 2. 华为系统性性能倍增策略带来的投资方向 - **国内晶圆代工产能**:华为芯片代工在国内进行,产品线扩展和“Taishan”架构从单层向多层堆叠演进,对国内晶圆厂产能带动作用最显著[15][16] - **自研HBM**:通过独特设计和全栈自研,HBM性能大幅提升,基本追赶海外主要厂商水平,某些细分性能指标可能更优[15][16] - **“Taishan”架构全面应用**:2027年陆续应用于计算芯片,技术路线与海外主流迭代路径分化,催生全新供应链,涵盖芯片设计、封装、测试等所有配套工艺环节和工具[16] - **NPO相关产业链**:无源器件、高速电连接Socket、配套封装和测试设备等多个板块受益[16]
华为追赶英伟达:把单卡之争变成一场集群战
虎嗅APP· 2026-09-21 21:45
华为AI芯片战略与竞争格局分析 核心观点 - 华为的目标是成为英伟达,但并非简单复制,而是通过系统级创新(超节点、集群、互联)在单卡性能受制于制程的前提下构建竞争力 [4][29] - 华为的核心优势在于支持客户构建优秀大模型,确保各种大模型能在昇腾、鲲鹏、超节点及集群上高效运行 [4] - 华为已从英伟达在中国最大的客户之一转变为直接竞争者,其策略是“像蛇一样用长链条布局和迂回方式咬住对手” [8][18] 华为与英伟达的竞争历史 - 2020年之前,华为曾是英伟达在中国最大的客户之一,其Atlas平台服务器售价六七十万元,仅英伟达算力卡就占40万元 [8] - 2016年CES期间,华为海思总裁何庭波向英伟达CEO黄仁勋请求技术授权被拒,回国后接触寒武纪但最终决定自研 [8] - 2017年,代号“达芬奇”的内部AI芯片预研究项目正式立项 [8] - 华为选择DSA(面向特定领域优化的专用架构)路线,而非英伟达的CMP(多芯粒异构封装)路线,将计算单元改造成三维立体方块阵列,提升每瓦功耗的AI算力 [9][10] - 2018年上半年,自研昇腾芯片项目正式启动,主要瞄准数据中心推理卡和边缘计算 [10] - 华为曾向英伟达申请CUDA层授权被拒,随后决定不比拼单卡参数,而是转向“一台机器、一个机架、一个集群、一个规模化数据中心”的系统级打法 [10] 国产AI芯片竞争格局 - 2025年底至2026年初,摩尔线程、沐曦股份、壁仞科技、天数智芯四家国产GPU公司密集上市,燧原科技于2026年9月登陆科创板 [11] - 四小龙中,摩尔线程、沐曦、壁仞采用GPGPU路线兼容CUDA,燧原科技和华为昇腾一样选择DSA路线但不兼容CUDA [11] - 2024年,英伟达和华为海思占据中国智能计算芯片市场94.4%的份额,四小龙合计份额不到2%,华为昇腾是份额最大的国产厂商 [11] - 真正在系统级、集群级与英伟达正面交锋的,目前只有华为一家 [12] 昇腾960系列芯片性能与路线图 - 昇腾960DT面向训练,比原计划提前三个季度,2027年第一季度就绪;960PR面向推理,提前一个季度,2027年第三季度就绪 [16] - 后续970、980将保持一年一代的迭代节奏 [16] - 昇腾960DT核心算力和存储能力较上一代翻倍,性能高于英伟达2023年发布的H200 SXM,但低于2025年下半年开始发货的B300,单卡水平大致相当于英伟达两年前的产品 [16] - 华为通过服务器、集群等方式提升整机算力密度,代价是功耗更高 [18] - 2023年上半年,910B芯片回归,解决了此前架构性缺陷,推理芯片性能达到英伟达的1.6至1.7倍 [19] - 2026年初,华为高层明确昇腾战略意义,决定通过一体机业务解决中小算力场景,至此中国市场能稳定支撑上万个节点集群运行的AI芯片只有华为昇腾 [20] 超节点与集群架构 - 昇腾960超节点采用NPO技术,2027年上市,最多塞进4096张卡,算力达8 EFLOPS FP8、16 EFLOPS FP4,内存容量1PB [23] - 华为用5500个自研Hi-ONE光引擎替换4.8万颗800G光模块,功耗降低超过550千瓦,无故障运行时间翻倍,一年内非计划停机不到18小时 [23] - 灵衢UnifiedBus将十余种互联协议统一,带宽从百GB级冲到TB级,延迟从7微秒压到2微秒,全局内存统一编址 [23] - 多个超节点通过二层CLOS四平面组网,最大能拉到51.2万卡,多轨道拓扑理论上能干到100万卡 [23] - 华为马尔科夫实验室仿真数据显示,由4K超节点组成的10万卡集群,MFU(模型算力利用率)提升2.75倍 [24] - 目前业界10万卡集群的MFU普遍不足30%,约七成时间处于故障及故障修复状态,MFU每提升1个百分点,10万亿参数大模型的训练周期可缩短约3天 [24] - 2.75倍是仿真数据,尚未有百万卡级集群在实际生产训练中的验证数据公开,汪涛承认“100万卡只是技术指标,实际部署中10万卡可以基本满足需求” [24] 生态建设与迁移成本 - 华为轮值董事长徐直军力排众议,拍板开源MindSpore框架,后宣布CANN异构计算架构全面开源开放 [26] - CANN开源社区月活开发者突破5200名,非华为外部开发者占比61% [26] - 昇腾成为首个被PyTorch官网直接支持并提供安装分支的中国算力平台,基于昇腾+CANN的原生训练模型已超过40个 [26] - 对于DeepSeek这类开源模型,借助现有生态支持,通常只需额外增加2至3名工程师、耗时约一个月便可完成训练适配 [27] - 对于仅公开权重、不开放源码的商业模型,可能需要约10名工程师额外投入6个月以上 [27] - 中国AI产业国产替代呈现“推理先行、训练滞后”局面,华为推出“MindSpeed-LLM Agent”及自动调优工具,将跨版本适配工作从数天压缩至1小时 [27] 市场份额与战略差异 - Bernstein Research预测,2026年华为将占据中国AI芯片市场50%份额,英伟达份额将从2025年的约40%萎缩至8% [29] - TrendForce预测更激进,认为国产AI芯片在国内高端市场的份额将接近90% [29] - 英伟达CEO黄仁勋确认该公司在中国AI加速器市场的份额降至0%,并称放弃中国市场“在战略上并不合理” [29] - 英伟达走“硬件极致优化”路线,用全球最先进制程、最强大单卡和CUDA生态锁定全球市场 [29] - 华为走“系统创新突围”路线,在单卡性能受制于制程的前提下,用超节点架构、光互联技术、集群规模和开源生态构建竞争力 [29] - 华为明确7纳米是关键底线,昇腾950系列基于全栈自主可控制造工艺,转向功耗优化、面积优化、3D堆叠等方向 [30] - 何庭波提出“韬(τ)定律”,以时间微缩替代几何微缩,以系统性降低时间常数为终极目标 [30] - 华为宣布未来三年将再投入50亿元建设开源开放算力新生态 [30]