帕累托前沿
搜索文档
突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达
机器之心· 2026-08-26 07:14
文章核心观点 OpenAI发布首款自研推理芯片Jalapeño,该芯片专为大语言模型推理设计,在能效和延迟方面超越NVIDIA GB200/GB300系统,并计划于2026年底部署,同时OpenAI将继续与NVIDIA合作 OpenAI自研推理芯片Jalapeño性能突破 - OpenAI公布首款自研推理芯片Jalapeño测试结果,专为大语言模型推理设计,通过全新架构同时提升吞吐量并降低延迟[2] - Jalapeño并非用于训练下一代GPT模型,而是针对模型上线后的运行阶段进行优化[5] - 传统硬件系统需在更高吞吐量和更低延迟之间取舍,Jalapeño目标是在一个架构中同时优化两者[6][7] - 在多个大模型推理测试中,Jalapeño优于NVIDIA GB200和GB300系统,测试模型包括OpenAI GPT-OSS 120B、DeepSeek R1 670B、Moonshot AI Kimi K2.5 1T[7] - Jalapeño可适配不同大模型工作负载,并非只针对OpenAI自家模型优化[10] - OpenAI在硬件上与Cerebras进行合作[10][11] Jalapeño能效与延迟优势 - Jalapeño核心优势是在相同功耗下完成更多AI工作,同时更快返回响应[16] - 在GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T上,Jalapeño在峰值吞吐量下实现1.5~1.9倍的每瓦AI工作量,端到端延迟降低至对比系统的1/1.7~1/3.6[17] - 对于高度交互式工作负载,性能优势达到2.1~4.1倍[17] - 在GPT-OSS 120B上,峰值每瓦吞吐量达到现有最佳系统的1.9倍[19] - 在DeepSeek R1 670B上,峰值每瓦吞吐量达到现有最佳系统的1.7倍[19] - 在Kimi K2.5 1T上,峰值每瓦吞吐量达到现有最佳系统的1.5倍,端到端延迟降低约3.4倍[19][20] - 在Kimi K2.5 1T上,随单用户解码速度提高,Jalapeño相比GB300的每瓦吞吐量优势从峰值1.5倍扩大至最高56.1倍[22] - 以DeepSeek R1为例,在对比系统此前最佳TBT对应条件下,Jalapeño每千瓦吞吐量达到12,258 mixed TPS/kW,对比GB300的118,相差约104.3倍[24] - 在DeepSeek R1 670B上,峰值每瓦吞吐量约为GB300的1.7倍,在相同解码速度下优势最高扩大至104.3倍[26] - Jalapeño额定功耗为700W,实际持续功耗始终保持在550W或以下[29] Jalapeño为Agent工作负载设计 - Jalapeño围绕现在及未来大语言模型,尤其是交互式Agent设计[31] - OpenAI将芯片、内存、网络、软件和机架级系统协同设计,让Jalapeño同时适应Prefill和Decode[32] - AI直接参与了Jalapeño芯片开发,从最初设计到流片设计定稿只用了9个月[33] - 使用GPT-Astra驱动的Codex,团队只用了2个月让三款开放权重模型实现高性能运行[33] - 在部分GPT-OSS Attention和MoE模块中,Codex生成实现比原有人类专家手写版本快1.5~1.8倍[34] 部署计划与行业背景 - OpenAI计划在2026年底前开始将Jalapeño部署到自身计算基础设施中[36] - Gen 2已进入深度开发阶段,Gen 3也开始成形[37] - OpenAI将Jalapeño效率变化总结为Ultra-fast、Fast、Batch三个档位[37] - OpenAI明确表示将继续大规模部署NVIDIA和其他合作伙伴的加速器,覆盖训练和推理工作负载[38] - 多家AI公司已下场造芯,包括Google TPU、Amazon Trainium/Inferentia、Microsoft Maia、Meta自研AI加速器[14]