Workflow
AI造芯
icon
搜索文档
用 Astra+Codex 干掉 CUDA,奥特曼9个月AI造芯反杀英伟达 GB300
36氪· 2026-08-26 17:10
核心观点 - OpenAI自研推理芯片Jalapeño在实测中,以不到对手一半的功耗,在吞吐量和延迟上全面超越英伟达GB200和GB300,标志着AI公司通过大模型自身能力绕过CUDA生态,重塑芯片设计产业链 [1][2][3] 性能对比与功耗优势 - Jalapeño额定700W,实测持续功耗不超过550W,而GB200 TDP为1200W,GB300为1400W [6] - 在峰值每瓦吞吐量上,Jalapeño在三款模型上分别达到对比系统的1.5至1.9倍,端到端延迟表现优于对手1.7至3.6倍 [6] - 在GPT-OSS 120B上对比GB200,Jalapeño每千瓦最高处理约8.54万个token/秒,GB200约4.5万个,前者约为后者的1.9倍,单用户生成速度Jalapeño约1459 token/秒,GB200约535 token/秒 [6] - 在DeepSeek R1 670B上对比GB300,Jalapeño峰值每千瓦吞吐量约1.96万token/秒,GB300约1.18万,前者高1.7倍,单用户生成速度Jalapeño约700 token/秒,GB300约169 token/秒,差距约4.1倍 [7] - 在Kimi K2.5 1T上对比GB300,Jalapeño每千瓦峰值吞吐量约1.82万token/秒,GB300约1.19万,前者高1.5倍,单用户生成速度Jalapeño约694 token/秒,GB300约182 token/秒,差距约3.8倍,最低端到端延迟分别为1.56秒和5.31秒 [7] - 在等速对比口径下,以DeepSeek R1为例,当两系统都维持约169 token/秒时,Jalapeño每千瓦处理约1.23万token/秒,GB300仅约118,差距约104.3倍,在GPT-OSS和Kimi K2.5上差距分别约53.7倍和56.1倍 [7] AI造芯流水线:硬件设计层 - OpenAI借助GPT-5.6 Sol优化电路,从最初设计到完成流片仅用9个月,AI被用于探索实现方案、缩短验证周期并优化算术电路,使核心计算面积显著缩减,而传统ASIC研发周期动辄数年 [8] - Jalapeño采用一整块Compute Die负责主要AI计算,左右各三颗共6颗HBM4提供高带宽内存,顶部I/O Chiplet负责数据通信 [9] - 芯片将计算核心与6颗HBM4内存切分成对应切片,每个核心切片直连本地HBM,走极简低延迟访问路径,切片间通过专用高带宽网络同步,大幅削减内存子系统固定开销 [9] AI造芯流水线:软件编译层 - Jalapeño底层算子采用接近汇编级的精细调优,部分单个算子代码达3000行,早期由工程师参与,随后大量使用内部增强版Codex让AI自动寻找更优算子实现 [10] - 在DeepSeek R1适配中,Codex在几乎没有底层算子工程团队介入的情况下,很快写出可运行且高效的MLA算子实现 [10] - 在GPT-OSS的部分注意力和混合专家模块中,AI生成的底层代码比此前人类专家编写的版本快1.5至1.8倍 [10] AI造芯流水线:模型移植层 - OpenAI开发了自研编程语言和编译引擎,将芯片设计成对人类和AI都清晰可预测的编程目标,彻底绕开CUDA生态,让AI直接把高层算法翻译成底层硬件配置 [12] - 英伟达自家GPU上跑的GPT模型,正被OpenAI用来设计要取代CUDA生态的芯片,形成自我强化的正向循环飞轮 [12] 行业影响与趋势 - 全球半导体行研机构SemiAnalysis判断,考虑到OpenAI能在自家芯片上如此快速适配新模型,CUDA的护城河岌岌可危 [8] - 算力供给已成为大模型演进的生死线,腾讯云CEO表示腾讯整体算力严重不足,已拖慢混元模型训练和产品发展 [13] - 模型公司亲自下场造芯、打通模型-软件-硬件垂直壁垒已从技术试水跃升为核心战略,Anthropic组建内部芯片团队并与三星讨论定制AI芯片,国内DeepSeek和智谱也需实现算力供给闭环 [13]
用 Astra+Codex 干掉 CUDA!奥特曼9个月AI造芯反杀英伟达 GB300
AI前线· 2026-08-26 16:23
核心观点 - OpenAI自研推理芯片Jalapeño在实测中,以不到对手一半的功耗,在推理吞吐量和延迟上全面超越英伟达GB200和GB300,标志着AI公司通过大模型自身能力攻破了CUDA生态壁垒,芯片行业竞争格局面临重塑[2][4][6] 芯片性能对比 - Jalapeño额定700W,实测持续功耗不超过550W,而GB200 TDP为1200W,GB300为1400W[13] - 在峰值每瓦吞吐量上,Jalapeño在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T上分别达到对比系统的1.9倍、1.7倍和1.5倍[24] - 端到端延迟表现优于对手1.7至3.6倍[13] - 在等速对比口径下,以DeepSeek R1为例,当单用户生成速度维持在约169 token/秒时,Jalapeño每千瓦可处理约1.23万token/秒,GB300仅约118,差距约104.3倍[21] - 在GPT-OSS和Kimi K2.5上,类似口径差距分别约为53.7倍和56.1倍[21] - Jalapeño在GPT-OSS上单用户每秒最高生成约1,459个token,GB200约535个token/秒[24] - 在DeepSeek R1上,Jalapeño单用户生成速度最高约700 token/秒,GB300约169 token/秒,差距约4.1倍[24] - 在Kimi K2.5上,Jalapeño单用户生成速度最高约694 token/秒,GB300约182 token/秒,差距约3.8倍,最低端到端延迟分别为1.56秒和5.31秒[24] 芯片规格参数 - Jalapeño FP8性能为3.4 PFLOPS,FP4性能为13.4 PFLOPS,HBM容量为216 GiB,HBM带宽为15.4 TB/s,TDP为700W[3] - 对比英伟达GB300:FP8性能5 PFLOPS,FP4性能15 PFLOPS,HBM容量288 GB,HBM带宽8 TB/s,TDP为1400W[3] - 对比英伟达Rubin:FP8性能17.5 PFLOPS,FP4性能35 PFLOPS,HBM容量288 GB,HBM带宽20 TB/s,TDP为1800-2300W[3] AI造芯流水线 - OpenAI利用自家旗舰模型GPT-6(代号Astra)和内部加强版Codex下场造芯,9个月完成硬件设计与优化,流片后3个月内从零设计出完整底层代码软件栈[4] - 硬件设计层:AI被用于探索实现方案、缩短验证周期,并直接优化芯片内部算术电路,使核心计算面积显著缩减,从设计到流片仅用9个月,而传统ASIC研发周期动辄数年[25] - Jalapeño采用一整块Compute Die,左右各三颗共6颗HBM4,顶部为I/O Chiplet,计算核心与HBM4切分成对应“切片”,每个核心切片直连本地HBM,走极简低延迟访问路径[27] - 软件编译层:OpenAI使用内部增强版Codex,让AI自动寻找更优的算子实现,在DeepSeek R1适配中,Codex在几乎没有底层算子工程团队介入下,很快写出可运行且高效的MLA算子实现[29] - 在GPT-OSS的部分注意力和混合专家模块中,AI生成的底层代码比此前人类专家编写的版本快1.5~1.8倍[30] - 模型移植层:OpenAI自研编程语言和编译引擎,绕开CUDA生态,让AI直接把高层算法翻译成底层硬件配置[32] 行业影响与趋势 - SemiAnalysis判断,考虑到OpenAI能在自家芯片上如此快速地适配新模型,CUDA的护城河岌岌可危[23] - 过去十年,Graphcore、寒武纪、Cerebras等挑战者都倒在CUDA软件高墙下,但新一代挑战者换成了大模型,它们在算力上“反噬”宿主,重塑芯片设计产业链[6] - 腾讯云CEO汤道生表示腾讯整体算力“严重不足”,已拖慢混元模型训练和产品发展[32] - 从Anthropic组建内部芯片团队并与三星讨论定制AI芯片,到国内DeepSeek和智谱,模型公司实现算力供给闭环已成共识[33] - 当AI介入芯片设计,软硬件协同的迭代速度将被彻底改写[33]