NVIDIA Groq 3 LPX
搜索文档
NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI
Globenewswire· 2026-08-24 23:00
产品发布与定位 - NVIDIA宣布Groq 3 LPX交互式AI推理加速器现已全面投产,是NVIDIA Vera Rubin平台的扩展[1][17] - Groq 3 LPX通过实现超快速token生成,为高度响应的代理系统提供重大AI推理性能提升[1] - 代理系统可在数百或数千个推理步骤中生成海量token,更快的token生成对于代理实时推理、行动和完成复杂任务至关重要[2] - Groq 3 LPX是专为交互式AI推理构建的加速器,旨在扩展Vera Rubin的交互性,即单个用户生成token的速率,决定代理完成每一步工作的速度[6] - 更快的生成使代理有更多时间检查文件、编写和测试代码、调用工具、验证结果和迭代,同时保持响应式用户体验[7] 性能表现 - 在Artificial Analysis基准测试中,运行Gemma 4 31B开源代理模型时,Groq 3 LPX创下每秒3,400个输出token的记录,上下文长度为100,000个token,是该模型有史以来最快的性能[4] - Groq 3 LPX使代理任务(如编码)在几分钟内完成而非数小时,为代理和延迟敏感型工作负载提供比最接近的替代平台快4倍的响应速度[4] - Vera Rubin NVL72系统为每个AI工厂提供最通用的训练和推理平台,Groq 3 LPX通过大幅提高token生成率扩展了Vera Rubin NVL72的推理性能[3] 行业影响与高管观点 - NVIDIA创始人兼CEO黄仁勋表示,推理是AI的增长引擎,Vera Rubin通过为代理AI时代设计的工作负载优化AI工厂配置扩展了这一愿景,LPX实现了超快token生成,在AI计算需求加速的背景下,带来了AI吞吐量、效率和响应性的又一次巨大飞跃[5] 生态系统与合作伙伴 - AI云正成为AI经济的引擎,Groq 3 LPX为服务延迟敏感、高容量推理工作负载的提供商提供了在成熟机架级系统中部署差异化计算的路径[8] - 领先AI云Nebius计划将NVIDIA Groq 3 LPX引入其生产推理平台Nebius Token Factory,使开发者能够为高度响应的代理AI应用获得极速token生成[9] - Nebius首席技术官Danila Shtan表示,生成是决定AI系统响应性的推理阶段,Nebius作为首个将其投入生产的AI云,通过开发者已使用的同一API确保代理循环的每一步都感觉即时,无需迁移到新堆栈[10] - 继Nebius之后,专用AI推理云Groq计划成为该平台最早的采用者之一[10] 技术架构与协同设计 - 通过跨七个芯片和五个专用机架的极致协同设计,NVIDIA Vera Rubin是最广泛的AI工厂平台[11] - NVIDIA Vera Rubin NVL72和Groq 3 LPX应对客户AI工厂的各种工作负载需求,包括前沿模型制造商和开放模型服务提供商[11] - 这些机架平台配备NVIDIA BlueField-4 DPU,并与NVIDIA Vera CPU机架、NVIDIA Vera BlueField-4 STX存储和NVIDIA Spectrum-6 SPX以太网协同工作,以优化多代理系统,实现每瓦最高吞吐量和最低延迟推理[12]