Workflow
Vera Rubin平台
icon
搜索文档
Rubin升级驱动硬件价值扩散,AI应用持续深化
开源证券· 2026-09-13 17:32
报告行业投资评级 - 计算机行业投资评级为“看好(维持)” [1] 报告的核心观点 - AI服务器价值主线已由GPU单点扩张迈入整机柜系统密度扩张阶段,Rubin平台以机架级协同设计推动算力、存储与互联全面升级,产业价值向整机柜系统及配套环节扩散 [4] - 模型迭代与Agent落地共振,AI正由内容生成迈向复杂任务交付,云端及端侧算力持续升级 [5] - AI算力相对表现占优,细分领域结构性机会持续显现 [6] 根据相关目录分别进行总结 1、 Rubin机柜价值结构重塑,机架协同定义系统新范式 1.1、 供需失衡传导至全链条,BOM成本与结构重塑 - 全球AI服务器市场维持高景气增长,2026年全球AI服务器出货量同比增速将超20%,占整体服务器比重提升至17% [15] - AI服务器出货量持续攀升,2023年约120万台,2024年升至175万台,2025年达217万至220万台,2026年攀升至265万至270万台,2027年有望突破320万台 [15][16] - 高盛将2026年DRAM涨幅预期由约150%上调至250%-280%,NAND由约100%上调至200%-250%,ABF载板、CCL同步上修,DRAM供需缺口达4.9%,或为十五年来最严重短缺,紧缺延续至2028年 [18] - 英伟达下一代旗舰计算平台Vera Rubin规模量产,采用极端协同设计理念,将数据中心视为计算的基本单元 [19] - Rubin VR200机柜整柜BOM较GB300提升约95%,GPU单柜价值由GB300的252万美元增至396万美元,增幅约57%,但占BOM比重由近三分之二回落至约51% [22][30] - 内存成为第二大价值池,单柜价值由约37.4万美元增至200.2万美元,增幅435%,占比升至26% [22][25] - 内存单柜价值由约37.4万美元增至约200万美元,增幅435%,为全部组件中最大单倍增量,已超过GPU成本的一半 [25] - PCB单柜价值由约3.5万美元增至11.7万美元,增幅233%,居全部组件之首 [26] - MLCC单柜价值由1530美元增至4320美元,增幅182% [27][28] - ABF载板单柜价值由1.1万美元增至2万美元,增幅82% [27][28] - 电源单柜价值由5.8万美元增至7.6万美元,增幅32% [29] - 液冷单柜价值由6.5万美元增至7.2万美元,增幅12% [29] - Rubin整机成本接近翻倍,核心驱动主要系存储等侧规格升级与供需涨价,而仅非GPU本身提价 [32] 1.2、 Rubin机柜核心架构拆解,关注高弹性细分环节 - NVIDIA Vera Rubin是面向Agentic AI时代的新一代全栈计算平台,将整座数据中心重塑为单一计算单元 [33] - Vera Rubin平台集成六款专用AI芯片,机架级原生融合计算、网络与基础设施 [35] - Vera Rubin NVL72以机柜为基本计算单元,通过NVLink 6全互联拓扑将72颗Rubin GPU与36颗Vera CPU封装为一台机架级超级计算机 [37] - 整柜提供3.6TB/s的单GPU带宽与260TB/s的横向扩展带宽,单位功耗的训练性能较Blackwell提升最高4倍、推理性能提升最高10倍,单Token成本降至前代约十分之一 [37] - 计算托盘集成4颗Rubin GPU与2颗Vera CPU,Rubin GPU集成224个流式多处理器与第五代张量核心,单卡配备288GB HBM4内存,在NVFP4精度下实现最高50 PetaFLOPS的推理算力 [40] - Vera CPU采用88核定制Olympus核心,通过空间多线程将有效线程数扩展至176个,单颗最高支持1.5TB LPDDR5X内存 [40] - 每颗Rubin GPU经NVLink 6提供3.6TB/s的双向互联带宽,较Blackwell的NVLink 5翻倍 [41][64] - NVLink-C2C以1.8TB/s的带宽实现Vera CPU与Rubin GPU之间的内存一致性通信 [41][64] - 计算托盘通过ConnectX-9 SuperNIC与BlueField-4 DPU承担网络与数据处理职能,每颗Rubin GPU提供1.6Tb/s的对外网络带宽 [43] - BlueField-4 DPU以800Gb/s带宽承担网络、存储与安全的卸载处理,计算能力达前代6倍,内存带宽达250 GB/s [46] - 计算托盘采用无缆线化设计,以刚性PCB中板取代内部铜缆与液冷软管,托盘组装时间由近两小时压缩至约五分钟,装配与维护效率提升最高20倍 [50] - 整柜共部署9个交换托盘,每个交换托盘集成4颗NVLink 6 Switch交换芯片,合计36颗交换芯片 [54] - NVLink 6使每颗GPU的互联带宽提升至3.6TB/s,整柜聚合带宽达260TB/s,每颗NVLink 6 Switch内置SHARP引擎,整柜合计130 TFLOPS的FP8网内计算能力 [60] - 单颗GPU最多支持36条NVLink链路,较前代18条翻倍 [64] - Vera Rubin NVL72依托Spectrum-X以太网构建面向AI工厂的横向扩展网络 [66] - Spectrum-X以太网交换机采用共封装光学(CPO)替代可插拔光模块,将功率效率提升5倍、网络韧性提高10倍、正常运行时间延长5倍 [70] - Vera Rubin NVL72实现100%液冷,以内部歧管与快接头构建起覆盖整柜的冷却分配网络 [73] - Rubin GPU冷板由传统流道升级为微通道设计,通道间距由前代的150微米收窄至100微米,冷板可在Max-P配置下处理单颗GPU约2300W的热负荷 [74] - Vera Rubin NVL72在供电架构上实现由低压直流向800V高压直流的跃迁,并以液冷母线承载急剧攀升的机柜功率 [76] 2、 计算机产业动态更新 2.1、 国内CSP厂商与大模型厂商最新动向 - DeepSeek发布V4.1 Flash模型,为552B参数的MoE模型,采用全新的Causal-Encoder-Decoder结构,输入激活仅8B、输出激活16B,成本显著低于已知同尺寸模型 [81] - V4.1 Flash对HBM需求较上代降至1/4、对SSD需求降至1/8 [82] - DeepSeek筹备科创板IPO,首轮融资总额达510亿元,投后估值近4000亿元 [83] - DeepSeek 2026年前7个月营收约4.75亿元,较2025年全年增长近10倍,综合毛利率44.6%,API业务毛利率达82.9%,同期净亏损约7.15亿元 [84] - 腾讯文档上线AI工作台,基于WorkBuddy提供的Agent内核框架,支持人机双写与后台执行任务 [85] - Kimi发布K2.8 Preview,所有会员档位均可用1M上下文 [87] - 月之暗面ARR在8月突破10亿美元,6月仅为3亿美元、3月约1亿美元 [88] 2.2、 海外CSP厂商与大模型厂商最新动向 - GPT-6 Astra正式开启大规模推送,已向Work/Codex中所有Pro、Enterprise与Business Premium用户开放 [89] - OpenAI正在内部测试GPT-6 Sol,单次测试速度约为Astra的6倍 [92] - OpenAI已将到2030年的预计算力支出从年初约6000亿美元上调至7500亿美元 [94] - OpenAI宣布投资200亿美元,在佐治亚州启动Project Camellia数据中心项目 [94] - OpenAI已与佐治亚电力达成协议,将于2028年至2032年间分阶段获得3.2GW电力供应 [95] - Meta发布个人AI助手Muse,定位“个人AI Agent”,可自行拆解任务、打开网页、填写表单并调用外部应用完成工作 [96] - 每个Muse用户获得一台独立运行的Muse Secure VM,Meta部署双系统架构,Muse负责理解目标与执行任务,Sentinel负责审查其向互联网发送的信息与准备采取的动作 [97] 2.3、 国产算力产业最新进展 - 华为发布麒麟9050 Pro芯片,是全球首款落地韬定律、采用逻辑折叠技术的旗舰芯片,每平方毫米晶体管数量比上一代多55%,若干关键任务功耗最高降低66% [99] - 麒麟9050 Pro CPU单核峰值性能提升24%、多核并发提升52%,GPU渲染性能提升142%,NPU实现行业首个端侧MoE全模态大模型入端,总参数300亿、激活参数20亿 [100] - 第27届中国国际光电博览会产业链普遍反映缺货及产能不足,部分产品订单与产能已排到2027年 [101] - 2026年800G仍是主要交付产品,1.6T已率先在头部厂商进入量产与商业化推进阶段 [101] - NPO战略地位大幅提升,被视为Scale-up场景确定性最高的落地方案,其上游元器件价值量占比约60%,单只6.4T NPO模组或需16个CW光源,高密度FAU单模组价值量从15美元跃升至200美元 [102] 2.4、 海外算力产业最新进展 - Arm发布CSS for Mobile 2平台,C2 CPU集群单线程性能最高提升15%、集群级多线程性能提升12%,最新AI模型性能最高提升70% [104] - Mali G2-Ultra NX集成专用神经网络加速器,神经图形场景下帧率与每帧能效最高提升4倍,DRAM流量最多降低13% [104] - 谷歌第七代TPU Ironwood在完全对等的模型负载下,每美元性能最高领先英伟达B200达50%,对B300的领先幅度逼近96% [105] - TPU每百万token成本仅需0.181美元,B200为0.222美元,B300高达0.276美元 [105] - 苹果发布首颗2nm手机芯片A20 Pro,CPU超级核心速度最高提升20%,GPU性能最高提升40% [107] - A20 Pro配备iPhone迄今最快内存接口,内存带宽较A19 Pro提升50% [107] 3、 上周市场表现回顾(2026/9/7-2026/9/11) - 计算机指数周度变动为-4.61%,同期沪深300指数下跌0.83%,上证指数下跌1.07%,创业板指上涨1.08%,科创50指数下跌1.52% [6][109] - 计算机指数分别跑输沪深300指数3.78个百分点、上证指数3.54个百分点、创业板指5.69个百分点和科创50指数3.09个百分点 [109] - 计算机板块在31个一级行业中排名第30位 [109] - AI算力指数周度变动约-1.67%,相对AI应用指数取得约1.62个百分点的超额收益 [6][111] - AI算力板块个股方面,火炬电子上涨14.02%,中际旭创上涨13.76% [6][114] - AI应用板块个股方面,深南电路上涨19.55% [6][117] 受益标的 - 国产算力:寒武纪、海光信息、禾盛新材、沐曦股份、浪潮信息、工业富联等 [7] - 海外算力:东山精密、胜宏科技、联特科技、德邦科技等 [7] - 算力租赁:宏景科技、利通电子、协创数据等 [7] - 大模型:智谱、MiniMax、阿里巴巴、腾讯控股 [7] - 液冷:盾安环境、同飞股份、恒铭达等 [7]