用 Astra+Codex 干掉 CUDA,奥特曼9个月AI造芯反杀英伟达 GB300
英伟达英伟达(US:NVDA) 36氪·2026-08-26 17:10

核心观点 - OpenAI自研推理芯片Jalapeño在实测中,以不到对手一半的功耗,在吞吐量和延迟上全面超越英伟达GB200和GB300,标志着AI公司通过大模型自身能力绕过CUDA生态,重塑芯片设计产业链 [1][2][3] 性能对比与功耗优势 - Jalapeño额定700W,实测持续功耗不超过550W,而GB200 TDP为1200W,GB300为1400W [6] - 在峰值每瓦吞吐量上,Jalapeño在三款模型上分别达到对比系统的1.5至1.9倍,端到端延迟表现优于对手1.7至3.6倍 [6] - 在GPT-OSS 120B上对比GB200,Jalapeño每千瓦最高处理约8.54万个token/秒,GB200约4.5万个,前者约为后者的1.9倍,单用户生成速度Jalapeño约1459 token/秒,GB200约535 token/秒 [6] - 在DeepSeek R1 670B上对比GB300,Jalapeño峰值每千瓦吞吐量约1.96万token/秒,GB300约1.18万,前者高1.7倍,单用户生成速度Jalapeño约700 token/秒,GB300约169 token/秒,差距约4.1倍 [7] - 在Kimi K2.5 1T上对比GB300,Jalapeño每千瓦峰值吞吐量约1.82万token/秒,GB300约1.19万,前者高1.5倍,单用户生成速度Jalapeño约694 token/秒,GB300约182 token/秒,差距约3.8倍,最低端到端延迟分别为1.56秒和5.31秒 [7] - 在等速对比口径下,以DeepSeek R1为例,当两系统都维持约169 token/秒时,Jalapeño每千瓦处理约1.23万token/秒,GB300仅约118,差距约104.3倍,在GPT-OSS和Kimi K2.5上差距分别约53.7倍和56.1倍 [7] AI造芯流水线:硬件设计层 - OpenAI借助GPT-5.6 Sol优化电路,从最初设计到完成流片仅用9个月,AI被用于探索实现方案、缩短验证周期并优化算术电路,使核心计算面积显著缩减,而传统ASIC研发周期动辄数年 [8] - Jalapeño采用一整块Compute Die负责主要AI计算,左右各三颗共6颗HBM4提供高带宽内存,顶部I/O Chiplet负责数据通信 [9] - 芯片将计算核心与6颗HBM4内存切分成对应切片,每个核心切片直连本地HBM,走极简低延迟访问路径,切片间通过专用高带宽网络同步,大幅削减内存子系统固定开销 [9] AI造芯流水线:软件编译层 - Jalapeño底层算子采用接近汇编级的精细调优,部分单个算子代码达3000行,早期由工程师参与,随后大量使用内部增强版Codex让AI自动寻找更优算子实现 [10] - 在DeepSeek R1适配中,Codex在几乎没有底层算子工程团队介入的情况下,很快写出可运行且高效的MLA算子实现 [10] - 在GPT-OSS的部分注意力和混合专家模块中,AI生成的底层代码比此前人类专家编写的版本快1.5至1.8倍 [10] AI造芯流水线:模型移植层 - OpenAI开发了自研编程语言和编译引擎,将芯片设计成对人类和AI都清晰可预测的编程目标,彻底绕开CUDA生态,让AI直接把高层算法翻译成底层硬件配置 [12] - 英伟达自家GPU上跑的GPT模型,正被OpenAI用来设计要取代CUDA生态的芯片,形成自我强化的正向循环飞轮 [12] 行业影响与趋势 - 全球半导体行研机构SemiAnalysis判断,考虑到OpenAI能在自家芯片上如此快速适配新模型,CUDA的护城河岌岌可危 [8] - 算力供给已成为大模型演进的生死线,腾讯云CEO表示腾讯整体算力严重不足,已拖慢混元模型训练和产品发展 [13] - 模型公司亲自下场造芯、打通模型-软件-硬件垂直壁垒已从技术试水跃升为核心战略,Anthropic组建内部芯片团队并与三星讨论定制AI芯片,国内DeepSeek和智谱也需实现算力供给闭环 [13]

Nvidia-用 Astra+Codex 干掉 CUDA,奥特曼9个月AI造芯反杀英伟达 GB300 - Reportify