Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍

软件栈优化与能效提升 - 英伟达通过软件栈优化,在三个月内将GB200 NVL72平台运行DeepSeek R1 0528模型时的每兆瓦算力吞吐量提升了4倍[1][2] - 该提升源于四个月内完成的38项重大优化,这些优化经过超过25万次模拟配置筛选及累计140万GPU小时的实测验证[1][2] - 超过90%的优化成果可跨模型复用,适用于其AI产品组合中的其他模型,使现有数据中心客户无需更换硬件即可通过软件升级获得显著能效收益[2] GB300平台训练性能突破 - GB300 NVL72平台在256卡规模下,对DeepSeek-V3 671B模型进行预训练,实现了每GPU 1648 TFLOPs的吞吐量,较GB200的606 TFLOPs提升约3倍,并创下该任务的全球最高纪录[1][3] - GB300 NVL72在Megatron Core框架下的性能,从2025年11月的1088 TFLOPs/GPU增长至2026年6月的1648 TFLOPs/GPU,六个月内累计提升约1.5倍[1][3] 主流AI框架协同优化 - 在TorchTitan框架上,GB300 NVL72对DeepSeek-V3 671B的训练性能,相较未优化基线配置提升6倍,从199 TFLOPs/GPU跃升至1197 TFLOPs/GPU[4] - 在JAX框架下,截至2026年7月,每GPU吞吐量达到4082 Tokens/s,对应1025 TFLOPs/GPU,较2026年1月的418 Tokens/s提升约10倍[4] 大规模训练扩展效率 - 在256至1024卡的扩展区间内,GB300 NVL72在三大主流框架下均维持了接近理论上限的扩展效率:Megatron Core达到98.5%,TorchTitan与JAX均达到97%[5] - 该扩展表现归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片,该高速互联能力是支撑跨框架高效率表现的核心基础设施组件[6] 平台演进与战略布局 - 英伟达下一代Vera Rubin平台已进入全球部署阶段,其NVL72型号在Token吞吐量上相较Blackwell实现约10倍提升,在同等150MW功耗下,GB200 NVL72约为80,000 Tokens/s,而Vera Rubin NVL72可达800,000 Tokens/s[7] - 公司在推进Rubin平台的同时,持续通过软件优化挖掘已部署的Blackwell硬件潜力,此举延长了现有客户的硬件投资回报周期,并强化了其在AI基础设施生态中的平台黏性与软件护城河[7]

Nvidia-Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍 - Reportify