英伟达震撼首测Vera Rubin,DeepSeek吞吐暴涨30倍

英伟达Vera Rubin与Agent时代算力革命 - 英伟达首次公布下一代旗舰机柜Vera Rubin NVL72的片上实测数据,并直接运行DeepSeek-V4-Pro执行真实智能体编码任务 [2][3] - 对比当前主力机皇GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高飙升30倍,Token成本最高暴降35倍 [3] - 从H200到GB300,真实Agent工作负载吞吐量提升最高30倍,成本大致翻倍 [4] - 从GB300到Vera Rubin,吞吐量再次飙升最高30倍,整机架价格大致再翻倍 [5] - 英伟达宣称LLM时代结束,Agent时代降临,以前的AI跑分基准全部作废 [5] - 专为智能体打造的Vera CPU已被马斯克的SpaceXAI连夜装机,并准备打上太空 [5] - 英伟达Groq 3 LPX全面量产,Gemma 4 31B在其上运行速度达到每秒3400个Token,万亿参数模型吞吐狂飙35倍 [6][7] Agent工作负载与传统基准的差异 - 真实世界里,一个Agent AI任务消耗的Token数量是普通聊天对话的15倍 [8] - 智能体交互次数越多,吞吐量越大——智能体数量多了10倍,工具调用多了2倍 [9] - 传统AI基准测试(如固定长度的8K/1K序列测试)彻底无效 [10] - 英伟达使用SemiAnalysis旗下的AgentX基准测试,回放真实的、具有上下文增长、工具调用和子智能体生成的代码编写会话 [10] Vera Rubin NVL72性能实测数据 - 在AgentX工作负载下,Vera Rubin NVL72的每兆瓦吞吐量比GB300 NVL72最高提升30倍 [12] - GB300在同样的DeepSeek-V4-Pro测试中,每兆瓦吞吐量已经比H200提升了15倍 [13] - 对于受制于电力供应的AI工厂,在同样电力预算下Vera Rubin能干30倍的智能体活儿 [14] - NVIDIA DSX MaxLPS技术可在GPU、机架和工作负载层面进行电源管理,在相同兆瓦预算内多配置高达40%的GPU [15] - Vera Rubin NVL72生产每百万Token的成本比GB300 NVL72最高降低35倍 [15] 极致协同设计的技术突破 - 性能提升靠的是极致协同设计,包括分离式服务、分布式KV缓存、KV感知路由、MegaMoE等 [17] - NVFP4量化将模型权重压缩到4位精度,在不牺牲输出质量的情况下大幅缩减内存占用 [18] - 第六代NVLink与大模型MoE提供比现成以太网快10倍、延迟低3倍的互联网络 [18] Groq 3 LPX推理加速器 - Groq 3 LPX是Vera Rubin NVL72数据中心平台的专属扩展,主打低延迟推理加速 [19] - 英伟达去年12月豪掷200亿美元从初创公司Groq手中买下该技术 [19] - Groq 3 LPX将庞大的上下文处理与Token生成彻底分离,Rubin GPU处理大规模上下文,Groq 3 LPX负责极速生成Token [20] - 在完整机架级部署中,多达256个LP30加速器可通过超高带宽互连与GPU协同作战 [21] - 在10万Token超长上下文窗口下运行Gemma 4 31B,输出速度达到3,400 Token/秒,响应速度比竞品快4倍 [22] - 生成5000 Token所用时间从50秒降至1.5秒,34倍差距 [23] - 在编码任务中最大输出速度6981 token/s [24] - Nebius已在Nebius Token Factory中部署该芯片 [26] Vera CPU与SpaceXAI部署 - 英伟达为Agent专门造了Vera CPU,配备88个自研Olympus核心,高带宽LPDDR5X内存带宽达1.2TB/s [26] - Agentic AI是史上最复杂的计算任务,一次任务背后要跑上百步:调用工具、执行Python代码、翻上下文、处理海量数据 [27] - SpaceXAI正式规模化部署英伟达Vera CPU,今年5月英伟达已将第一批Vera样片送到A社、OpenAI、SpaceXAI试水 [27] - 仅3个月后SpaceXAI将其转入全面部署,并基于Vera Rubin平台建设吉瓦级算力工厂驱动Grok [28] - SpaceXAI设计优化版Vera Rubin NVL72,将在2028年大规模部署 [28] - SpaceXAI第一代Starmind AI卫星计划采用Vera Rubin NVL72机架级系统 [28]

Nvidia-英伟达震撼首测Vera Rubin,DeepSeek吞吐暴涨30倍 - Reportify