Workflow
硅光平台技术
icon
搜索文档
华为全联接2026解读
2026-09-21 22:47
华为升腾960系列及NPO技术演进电话会议纪要关键要点 一、涉及的行业与公司 - **行业**:AI算力芯片、光通信、半导体设备与封装测试 - **公司**:华为(海思)、NVIDIA、阿里、腾讯、Mellanox、Coherent、Marvell 二、核心观点与论据 1. 升腾960系列芯片性能与上市时间 - 升腾960DT(训练)预计2027年Q1上市,较原计划提前三个季度[2] - 升腾960PR(推理)预计2027年Q3上市[2] - 960DT的FP8和FP4算力较950DT翻倍[2] - 960PR的FP8算力与前代持平,FP4算力翻倍至8 PFLOPS,是950DT的四倍[2] - 960DT的HBM容量达288GB,带宽9.6 TB/s,分别是950DT的两倍和两倍多[2] - 960DT采用8颗HBM,单颗容量36GB,带宽1.2 TB/s,性能介于HBM3E与HBM4之间[2] - 960PR的HBM容量192GB,带宽2.4 TB/s,单颗容量16GB,带宽200 GB/s,性能略优于HBM2E[2] - 960DT和960PR互联带宽均为2.2 GB/s,高于NVIDIA B200/B300的1.8 GB/s[2] 2. 升腾970/980性能规划与超晶粒技术 - 升腾970预计2028年上市,FP8算力3.6 PFLOPS,FP4算力14 PFLOPS,对标NVIDIA B300[3] - 升腾980预计2029年发布,FP8和FP4算力再次翻倍,分别达7.2 PFLOPS和28 PFLOPS[3] - 升腾970和980均基于“超晶粒”技术打造[3] - 鲲鹏960 CPU(2028年Q1上市)采用两层逻辑芯片堆叠,鲲鹏970采用三层逻辑堆叠[3] - 消费端Mate X D two已首发搭载三折叠形态的9,050 Pro手机端“超晶粒”芯片[3] 3. 960超级节点集群配置与架构 - 1,024卡规模集群配置1,024个GPU和256个CPU,采用独立液冷机柜[4] - 集群使用1,312颗交换芯片,包括1,280颗一级和32颗二级交换芯片[4] - 每个机柜增加8颗一级交换芯片(从72颗增至80颗)用于连接冗余[4][5] - 使用超过4万米光纤和超过19万根铜线,柜内用铜线、柜间用800G光模块[5] - 整体架构以升腾总线为基础,连接GPU、CPU和存储超级节点[5] - 鲲鹏950 CPU超级节点最大支持4,096个节点组网[5] - OceanStor A900液冷存储节点单集群提供64PB存储容量和400GB/s聚合带宽[5] 4. 960超级节点连接方式变化 - 960超级节点将GPU和CPU集成在同一刀片,每个刀片含8个GPU和2个CPU(4:1比例)[7] - 950超级节点中NPU和CPU分开部署[7] - 960超级节点首次采用NPO(近封装光学)技术进行连接[7] 5. NPO技术优势与行业共识 - NPO通过Socket方式将光引擎连接在主芯片附近,缩短电信号传输距离,实现可拆卸可维护[8][9] - CPO集成度最高但良率、散热和可维护性挑战巨大[8] - NPO可复用相对成熟的光通信产业链,被认为是更容易规模化部署的方案[9] - 国内外在NPO技术路线上已形成较高共识,海外厂商自2026年Q2开始从CPO转向NPO[9] 6. 华为NPO布局与时间节点 - 2025年5月首次提及光互联,2025年9月海思介绍“Hi-One”NPO方案[10] - 2026年7月联合产业链发起Open NPO项目,2026年9月深圳光博会实物展示[10] - 4,096卡960超级节点系统使用约5,500个“Hi-One”NPO,替代约4.8万个800G LPO模块[10] - 带宽提升约8至9倍,系统功耗降低超过550千瓦,无故障运行时间提升一倍,可用度达99.8%[10] - 2027年Q2上市8,860风冷版本,2027年Q3推出960液冷版本[10] - 光引擎器件需在2027年Q1开始量产,快于市场预期的2027年下半年[10] 7. “Hi-One”NPO技术特点 - 采用基于氮化硅SOI的硅光平台,拥有36路单波200G通道[11] - 采用内置光源方案,激光器功率约100-150毫瓦,省去保偏光纤布线[11] - 主流外置光源方案需300-400毫瓦以上功率,保偏光纤产能有限且价格较高[11] - 内置光源面临高温温漂、稳定性及系统一致性挑战[11] - 单片集成超过2000个光学器件,通道数从传统8或10个提升至32个以上[13] - NPO方案通常不再使用DSP,信号补偿功能迁移到TIA和Driver等电芯片[13] 8. 产业主导权变化 - 传统光模块时代主导权在光模块厂商[13] - NPO时代主导权向系统厂商迁移,华为推出Open NPO标准,阿里和腾讯推出各自NPO标准[13] - 海外有Open CXL Consortium等标准,参与者包括Mellanox、Coherent和Marvell[13] 9. 未来驱动超级节点放量的应用场景 - AI应用商业化变现,推理算力需求持续增强[6] - 大语言模型持续投入,国内至少10家公司进行10T级别大模型迭代,每家公司需至少20万张AI卡,国内增量超200万张卡[6] - 政企市场智能化改造,从软件开发扩展到金融、医药等行业[6] - 智能驾驶领域,预计2027年L3级别自动驾驶牌照发放将大幅增加算力需求[6] - 计算智能,远期需求空间巨大[6] 三、其他重要但可能被忽略的内容 1. NPO产业链核心受益方向 - **高密度无源器件**:量价齐升,NPO光引擎通道数达32或36个,增加FAU、MT插芯、MPU、Isolator和透镜等需求[14] - 超算集群规模扩大增加系统层面高密度光连接需求[14] - NPO/CPO对耦合精度、插损和一致性要求远高于传统光模块,单个器件价值量显著提升,MT插芯和V-Groove价格已大幅上涨[14] - **高速电连接Socket**:引脚数可达300个左右,未来可能超过500个,包含高速电信号连接和供电功能[14] - 对电连接精度和性能要求比CPU中Socket方案更高,壁垒高于传统Socket[14] - **设备端**:预计2026年Q4出现放量迹象,NPO光引擎生产需贴片、键合、耦合、先进封装和测试设备[15] - NPO光引擎自身需通过2D或2.5D先进封装实现PRC和ERC封装,对具备光电合封工艺的先进封装厂商构成增量[15] 2. 华为系统性性能倍增策略带来的投资方向 - **国内晶圆代工产能**:华为芯片代工在国内进行,产品线扩展和“Taishan”架构从单层向多层堆叠演进,对国内晶圆厂产能带动作用最显著[15][16] - **自研HBM**:通过独特设计和全栈自研,HBM性能大幅提升,基本追赶海外主要厂商水平,某些细分性能指标可能更优[15][16] - **“Taishan”架构全面应用**:2027年陆续应用于计算芯片,技术路线与海外主流迭代路径分化,催生全新供应链,涵盖芯片设计、封装、测试等所有配套工艺环节和工具[16] - **NPO相关产业链**:无源器件、高速电连接Socket、配套封装和测试设备等多个板块受益[16]