公司产品路线图与战略定位 - Cerebras Systems (NASDAQ: CBRS) 在CEO Andrew Feldman主持的公司活动中,概述了以更快AI推理、扩展数据中心容量以及与OpenAI、Arista Networks和AMD新合作为核心的产品路线图 [1] - Feldman表示公司近期上市,旨在将其晶圆级计算技术定位为实时AI应用的基础设施平台,并认为推理速度已成为产品层面的考量,而非单纯的技术基准,尤其是在AI向交互式工具和自主代理转变的背景下 [2] - Feldman强调“在AI中,速度就是生产力”,更快的响应时间使用户能够运行更多工作负载并处理更复杂任务,无需在模型智能与延迟之间进行传统权衡 [3] OpenAI合作与Ultrafast服务 - Feldman重点介绍了OpenAI近期发布的GPT-5.6 Sol Ultrafast模式,该模式运行OpenAI最智能模型的速度比标准产品快达14倍,且由Cerebras硬件提供支持 [4] - 根据Feldman展示的基于“人类最后考试”研究生级推理基准测试对比,Cerebras驱动的系统在11小时11分26秒内完成了全部2500道题的基准测试,而对比系统耗时超过三天 [5] - OpenAI技术团队成员Thibault Sottiaux表示,公司策略是构建领先模型并大规模提供服务,且日益关注代理,超快推理减少了在较小低延迟模型与较大响应慢模型之间选择的必要 [6] - Sottiaux称OpenAI希望Ultrafask能随时间推移成为默认体验,但部署仍处于早期阶段,公司为事件、安全事务、重大内部项目和研究预留部分Ultrafast容量,同时通过API为客户分配容量 [7] - Sottiaux补充ChatGPT用户已超过10亿,而更复杂的代理工作流用户群虽小但增长迅速,Feldman称OpenAI的Codex和ChatGPT代理每周有1500万用户 [8] 数据中心建设与基础设施合作伙伴 - Feldman表示Cerebras在北美和欧洲运营或开发数据中心,地点包括圣克拉拉、多伦多、达拉斯、明尼阿波利斯、蒙特利尔、俄克拉荷马城、阿拉巴马、法国里昂、挪威以及芬兰米凯利,公司已获得600兆瓦电力,这些电力已上线或已签约将于明年年底前交付 [9] - Arista CEO Jayshree Ullal表示AI基础设施需要协调网络与计算能力,并描述了网络在纵向扩展、横向扩展和地理分布式“跨域扩展”部署中日益增长的重要性 [10] - Ullal指出AI工作负载不同于传统云流量,需要能处理不同流量模式、模型类型和代理工作负载的网络,带宽需求可能持续快速增长,未来几年网络速度可能达到3.2太比特和6.4太比特 [11] - Feldman与AMD执行副总裁兼首席技术官Mark Papermaster讨论了分解式推理方法,该方法下GPU处理推理的“预填充”阶段,而Cerebras系统处理“解码”阶段 [12] - Feldman称这种组合可提供比GPU快10倍的推理速度,且吞吐量是Cerebras单独运行的5倍,Papermaster表示该合作结合了GPU在并行计算方面的优势与Cerebras的低延迟解码能力 [13] 下一代CS-4系统 - Cerebras CTO兼联合创始人Sean Lie介绍了公司下一代CS-4系统,该系统已进入早期访问阶段,预计本季度晚些时候全面上市 [14] - Lie表示CS-4围绕公司Nexus机架级平台设计,单个系统包含三个晶圆级引擎,平台将提供高达当前CS-3代两倍的令牌生成速度、六倍的系统级性能、每机架三倍的密度,以及在某些解决方案中高达每瓦特10倍的令牌数 [15] - 据Lie介绍,该系统使用公司WSE-3 Turbo芯片,每个晶圆提供每秒43 PB的内存带宽,架构旨在减少跨多芯片移动模型权重带来的瓶颈,并通过低延迟晶圆间连接支持更大模型 [16] - Lie称Nexus架构旨在支持未来的CS-5和CS-6系统,Cerebras路线图要求每年速度翻倍,到2027年提供吞吐量高达20倍的解决方案 [17] - CS-4预计提供比GPU解决方案快30倍的令牌生成速度,系统每晶圆I/O带宽是上一代的两倍,网络延迟更低,模块化机架架构旨在减少50%的组件,并将数据中心部署时间从数天缩短至数小时 [22] AI代理与时间敏感应用 - Cerebras产品高级副总裁Jessica Liu表示,快速推理可通过在相同时间预算内允许更多模型调用、规划循环和工具使用来提高AI代理的实用性,而较慢系统会迫使用户选择更小模型或等待更长时间以获得更强大的代理 [18] - Figma、Cognition和CrowdStrike的发言人描述了更快模型推理在设计、软件工程和网络安全领域的应用,Figma AI研究产品负责人Pavi Bhatter称其Design Agent(目前处于测试阶段)使用Cerebras硬件使设计工作流程更具交互性 [19] - Cognition的Silas Alberti表示公司已在Cerebras上部署编码模型,并在某些用例中报告了更快的端到端任务完成速度 [19] - CrowdStrike工程副总裁Keith Coley表示网络安全决策高度时间敏感,与Cerebras的合作可在可接受的响应窗口内进行更多基于AI的检查 [20]
Cerebras Unveils CS-4, OpenAI and AMD Partnerships to Accelerate AI Inference