低延迟AI推理
搜索文档
瞄准低延迟AI推理市场 英伟达(NVDA.US)Groq 3 LPX全面量产 首批系统将部署于NEBIUS(NBIS.US)
智通财经网· 2026-08-25 00:18
英伟达Groq 3 LPX量产与AI推理市场布局 - 英伟达宣布Groq 3 LPX机架级系统进入全面量产阶段,标志着去年约200亿美元收购Groq相关资产后,低延迟AI推理技术正式商业化落地[1] - 首批系统将部署于AI云计算服务商NEBIUS,计划今年晚些时候上线[1] - Groq 3 LPX将与英伟达Vera中央处理器和Rubin图形处理器共同部署在Nebius数据中心[1] - 英伟达于去年12月斥资约200亿美元收购AI芯片初创公司Groq相关资产,为公司历史上规模最大的收购交易[1] - Groq芯片架构特点是在芯片内部集成500MB高速SRAM,减少传统内存访问造成的数据传输瓶颈,提高AI模型推理响应速度[1] - 英伟达目前将256颗Groq 3芯片集成至一个LPX机架中[2] - 根据英伟达引用Artificial Analysis基准测试数据,Groq 3 LPX系统能实现每秒生成约3400个token的性能[2] - 英伟达高级总监Dion Harris表示,Groq芯片并不是为了取代传统GPU,而是针对工作负载的不同部分使用价格和性能最合适的处理器[2] - 英伟达正在建立更加细分的AI计算架构:Vera CPU和Rubin GPU承担更广泛AI计算任务,Groq芯片针对延迟高度敏感的推理工作负载优化[2] 低延迟推理市场竞争格局 - 随着AI行业从大规模模型训练进入推理需求快速增长阶段,低延迟推理市场竞争正在升温[3] - AMD今年早些时候宣布将其机架级AI系统与Cerebras芯片整合,同样重点瞄准低延迟AI推理[3] - OpenAI最新公布的Ultrafast模式承诺达到每秒750个token,并由Cerebras提供底层算力支持[3] - 英伟达引用的基准测试数据显示Groq 3 LPX能达到每秒3400个token,但不同系统测试条件和应用场景存在差异,不能简单视为直接性能对比[3] - 英伟达正在加快Vera Rubin系统出货,该平台已于今年早些时候进入生产阶段[3] 英伟达战略规划与市场预期 - 英伟达CEO黄仁勋今年3月预计,从Blackwell芯片到新一代Vera Rubin系统,截至2027年的累计销售额可能达到1万亿美元[4] - 黄仁勋透露,在专门用于AI编程应用的数据中心空间中,计划将约四分之一配置给Groq芯片,其余部分全部部署Vera Rubin系统[4] - 随着AI智能体、AI编程以及实时生成式AI应用快速发展,推理速度正成为云计算企业和AI开发商竞争的重要指标[4] - 英伟达正从以GPU为核心的AI芯片供应商,进一步扩展至针对不同AI工作负载提供专用计算架构[4] - 市场将关注英伟达本周三公布的财报,除Blackwell和Vera Rubin需求之外,AI推理业务以及Groq商业化进展可能成为投资者关注新焦点[4]