英伟达GB200
搜索文档
背刺英伟达?OpenAI甩出新“武器”!
格隆汇APP· 2026-08-26 10:47
核心观点 - OpenAI自研推理芯片Jalapeño在吞吐、能效、延迟三项指标上全面反超英伟达GB200与GB300,并被认为超越了英伟达Rubin芯片 [1][3] - 该芯片由OpenAI与博通合作开发,设计到流片仅用9个月,AI辅助设计是关键 [5] - SemiAnalysis判断CUDA的护城河可能已死,但OpenAI与英伟达的绑定仍在加深 [7] 芯片性能对比 - 单用户出词速度:Jalapeño每秒1459个Token,GB200为535个 [1] - 任务完成时间:Jalapeño用1.65秒,GB300花了5.99秒 [1] - 功耗:Jalapeño标称700瓦,实测持续功耗压在550瓦以内;GB200/GB300标称1400瓦 [1] - 每瓦AI工作负载提升1.5至1.9倍,端到端延迟降低1.7至3.6倍,高度交互式负载下优势扩大到2.1至4.1倍 [3] 芯片设计与制造 - 设计到流片仅用9个月,业内常见周期为18到36个月 [5] - 将自家最强模型GPT-Astra和Codex用于AI辅助设计,使SIMD单元面积减少8%、矩阵引擎面积减少10% [5] - 在注意力与MoE模块上,AI生成的代码比人类顶尖专家快1.5到1.8倍 [5] - 主计算die约840平方毫米,距EUV掩模版极限858平方毫米只差18平方毫米 [5] 硬件规格与成本 - 配6颗HBM4、共216GiB、15.4TB/s [5] - 每瓦HBM带宽22,第二名Rubin是11.1,GB300只有5.71 [5] - 每芯片每小时总拥有成本1.56美元,与H100的1.55美元几乎持平,Vera Rubin是3.61美元 [5] - 与博通合作,两家于去年10月签下10GW定制加速器大单 [5] 量产与未来规划 - 量产2027年逐步爬坡,下一里程碑是100兆瓦 [5] - Gen2已在深度开发、Gen3正在成形 [5] - 2026年底先部署进OpenAI自己的数据中心 [5] 行业竞争格局 - 英伟达Rubin比Jalapeño早一个月完成CoWoS流片,但外界能看到的成绩只有CoreWeave工程样片数据 [7] - 英伟达没有像OpenAI这样把第三方放进实验室随便测 [7] - SemiAnalysis判断CUDA的护城河可能已经死了 [7] 英伟达与OpenAI的绑定关系 - 8月17日,英伟达同意为OpenAI俄亥俄州数据中心园区提供最高1050亿美元融资 [7] - OpenAI承诺2026年下半年部署首批1吉瓦英伟达Vera Rubin系统 [7] - OpenAI芯片负责人Richard Ho表示仍需要大量英伟达芯片 [7] - 这一切落在英伟达财报前夜,焦点包括OpenAI算力承诺的会计处理 [7]
你敢信,OpenAI第一次做芯片,竟然把英伟达全系干趴下了?!
是说芯语· 2026-08-26 09:00
核心观点 - OpenAI首颗自研芯片Jalapeño在AI推理性能上全面反超英伟达GB200和GB300,标志着AI芯片竞争格局的重大变化 [1] - OpenAI通过AI辅助芯片设计,将模型、芯片和软件拧成加速飞轮,对英伟达的CUDA护城河构成实质性威胁 [54][55][60] Jalapeño芯片性能实测 - Jalapeño每秒可生成1459个Token,英伟达GB200仅535个,不到一半 [3] - Jalapeño完成一个任务仅需1.65秒,GB300需约6秒,差距达3.6倍 [4] - 将GB300推至最快解码速度时,Jalapeño吞吐量是GB300的104.3倍 [4][23] - 在GPT-OSS 120B、670B和1T模型上,Jalapeño分别快2.7倍、4.1倍和3.8倍 [25] - 两个Token之间间隔仅0.69毫秒 [18] - 标称功耗仅700W,GB300为1400W,整整一半 [5] - 每瓦特AI工作负载提升1.5–1.9倍,端到端延迟降低1.7–3.6倍,高度交互式工作负载性能提升2.1–4.1倍 [15] - 按各自最好工作点算峰值,差距温和至1.9倍、1.7倍和1.5倍 [31] - 真正拉开距离的是高交互场景,随着出词速度提升,领先幅度从1.7倍涨至104.3倍 [30][32] 系统级能效与成本 - 将供电、散热、网络全算入后,Jalapeño每颗1.125千瓦,GB200为1.87千瓦,Vera Rubin为3.3千瓦 [34] - 跑GPT-OSS时,Jalapeño每兆瓦每秒吐出约5300万个Token,GB200 NVL72仅约1000万 [34] - 每芯片每小时总拥有成本,Jalapeño为1.56美元,与H100的1.55美元几乎一样,Vera Rubin为3.61美元 [35] - 每瓦HBM带宽Jalapeño为22,第二名Rubin为11.1,GB300仅5.71,高出整整一倍 [52] - 每瓦FLOPs Jalapeño为19.1,Rubin为19.4几乎打平,但Rubin需烧1800瓦以上,Jalapeño仅700瓦 [52] 未开启的优化潜力 - 上述成绩未开启投机解码和Token预测,也未做prefill和decode分离部署,而对比芯片均跑在各自最优配置 [37] - SemiAnalysis估算,仅投机解码一项就能将每Token成本再压掉2/3以上 [38] AI辅助芯片设计 - 从设计到流片仅用九个月,业内常见周期为18-36个月 [43] - 协助开发的模型为GPT-Astra(外界传的GPT-6),成为团队最强辅助 [44][46] - AI辅助设计使SIMD单元面积减少8%,矩阵引擎面积减少10%,且时序和功耗更优 [47] - 主计算die约840平方毫米,EUV光刻机掩模版极限为858平方毫米,离物理天花板仅差18平方毫米 [50][51] - B0步进已在晶圆厂,每瓦性能比A0再高约25% [53] - 在注意力机制和MoE模块上,AI手敲代码比人类顶尖专家快1.5到1.8倍 [53] 对英伟达CUDA护城河的冲击 - SemiAnalysis判断CUDA护城河可能已死,理由是速度 [60][61] - 英伟达Rubin比Jalapeño早一个月完成CoWoS流片,但外界仅能看到CoreWeave工程样片数据,英伟达未像OpenAI那样让第三方随意测试 [62] - 问题出在软件起步速度,英伟达硬件本身没毛病 [63] - OpenAI从零开始无历史包袱,架构可完全按白纸来画 [64] - 英伟达自己的GPU正在实时催生自己的接班人 [65] 未来路线图与战略布局 - Jalapeño仅为第一代,Gen2已在深度开发,Gen3正在成形 [73] - 量产要到2027年逐步爬坡,下一个里程碑是100兆瓦 [74] - 去年10月OpenAI与博通签署10GW定制加速器合作大单 [68] - 10GW量级相当于约十座核电机组满发 [70] - 数据中心大总管Chris Malone(负责星际之门项目)离职,但核心高管离场挡不住路线继续向前 [76][79]
马斯克、黄仁勋深度绑定,押注太空算力!SpaceX承诺再买22万块英伟达"超级芯片",汇丰: 将导致AI算力过剩,削弱大模型企业定价权
每日经济新闻· 2026-08-25 22:51
英伟达与SpaceX的深度绑定及太空算力布局 1) 文章核心观点 英伟达通过投资xAI间接成为SpaceX第六大股东,双方在AI计算领域形成深度绑定关系,SpaceX未来AI算力将完全基于英伟达平台建设,并计划大规模部署太空算力,但汇丰研报指出此举长期可能导致全球AI算力供给过剩和价格下行压力 2) 关键要点总结 英伟达与SpaceX的资本与商业关系 - 英伟达持有近1.23亿股SpaceX股票,按8月19日139.65美元/股计算价值约171.5亿美元,为SpaceX第六大股东[1] - 该持仓主要来自英伟达今年1月对xAI的100亿美元投资,2月SpaceX全股票收购xAI后转换为约1.228亿股SpaceX A类股票[3] - 马斯克明确表示SpaceX未来新增AI算力将完全基于英伟达Vera Rubin架构建设,称“我们只与英伟达合作”[5] - 目前没有公开证据显示英伟达对xAI的100亿美元投资直接用于SpaceX采购英伟达GPU,尚不能认定形成严格资金闭环[4] SpaceX的AI算力规模与扩张计划 - SpaceX核心AI基础设施包括Colossus和Colossus II数据中心,合计拥有约1GW额定算力,已部署约32万块英伟达处理器[5] - Colossus首批部署约10万块H100,Colossus II部署约11万块GB200和11万块GB300,下一阶段将至少增加22万块GB300[5] - 若按计划完成,SpaceX现有和下一阶段集群将涉及至少54万块英伟达H100、GB200和GB300[6] - 马斯克预计到2026年底AI计算容量超2GW,到2027年底累计计算容量接近10GW[6] SpaceX的AI业务收入与客户 - SpaceX已开始向外出售计算能力,与Anthropic签署云服务协议涉及约32.5万块英伟达GPU,每月费用12.5亿美元[6] - 谷歌与SpaceX签署云服务协议涉及约11万块英伟达GPU,从今年10月开始月度费用9.2亿美元[6] - 两笔合约锁定每月21.7亿美元现金流,第二季度AI业务收入达25.61亿美元,同比增长约247%,占当季总收入78.1亿美元近三分之一[6] - 同期AI相关资本开支达158亿美元[6] 太空算力布局与监管进展 - SpaceX向FCC申请建设“轨道数据中心系统”,最多由100万颗卫星组成,运行高度约500公里至2000公里,通过光学星间链路连接[7] - SpaceX目标是最终每年向太空部署100GW计算能力,每年需将约100万吨物资送入轨道并进行数千次发射[8] - 英伟达发布Space Computing平台及Space-1 Vera Rubin Module,黄仁勋称“太空计算这一最后的前沿已经到来”[8] 汇丰研报对AI算力过剩的警示 - 汇丰测算到2030年全球AI数据中心年新增需求不足50GW,SpaceX内部建设规模大于实际消耗将导致供给过剩和价格下行压力[9] - 地面短期资本开支高企加剧供应链紧张,预计2027年起超大规模云厂商年投资或将突破1万亿美元[9] - 充足的廉价算力会催生大模型厂商竞争白热化,削弱定价权,软件企业可切换不同大模型降低成本留存利润[10] - 各家大模型能力本就在趋同,开源模型获得更多算力资源将进一步加速这一趋势[10]