智谱新模型“牛来”跑在10万国产卡上,SemiAnalaysis评价“英伟达护城河再受考验”

核心观点 - 智谱以匿名模型Ox Alpha形式发布GLM-5.3-Flash,5天内流量超50万亿token,全部由国产芯片承载,硬件效率与单token成本已可比肩英伟达GPU [1] 国产芯片集群部署与性能 - 智谱调用超过10万张国产芯片集群用于GLM-5.3-Flash推理服务,硬件效率及单token成本已达到与主流英伟达GPU相当的水平 [1] - 单张芯片主要瓶颈在于内存容量与带宽,支持长达100万token上下文长度尤为困难 [2] - 智谱在SGLang基础上构建专用推理引擎,采用W8A8量化、INT8/FP8/BF16混合缓存量化及节点内张量并行技术,并引入生产级EPD分离式架构 [2] - 与同一硬件上的初始基线相比,端到端服务性能提升了3倍 [2] - 芯片供应商或来自华为、摩尔线程与海光,智谱官方未予置评 [3] - SemiAnalysis指出,每日100万亿token的免费流量全部跑在国产芯片上 [3] 模型性能与定价 - GLM-5.3-Flash参数规模为320B总参数,激活参数18B,参数量约为上一代旗舰GLM-5.3的40%,与DeepSeek V4 Flash几乎持平 [3] - 在AA综合智能指数中取得57分,超过上一代旗舰GLM-5.2,与Claude Opus 4.8持平,高于DeepSeek V4 Pro正式版的53分 [3] - 每百万token输入0.8元,输出2.8元,缓存命中价格0.23元,为GLM-5.3的十分之一,上线前两周实行半价 [3] - 定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Claude Opus 4.8的1/40 [4] - 与调价后的DeepSeek V4 Flash相比(谷时输入1.5元、输出4.5元),GLM-5.3-Flash在绝大多数常规调用场景下更便宜 [5] 架构创新 - GLM-5.3-Flash采用与GLM-5.3完全不同的架构设计,总参数量相近(355B vs 320B),但激活参数量从32B降至18B,层数从92层减至45层,几乎减半 [6] - 首个采用稀疏注意力与线性注意力混合架构的开源前沿模型 [6] - 相较于GLM-5.3,注意力计算量与KV缓存大小分别降低了3.01倍和4.44倍 [6] - 是GLM-5系列首个原生多模态模型,支持图像和视频输入,也是智谱战略聚焦coding以来首次推出具备多模态能力的新模型 [6] 市场定价策略与竞争格局 - GLM-5.3-Flash发布发生在中国AI模型市场一轮集体涨价之后 [7] - Kimi K3输出价格高达每百万token 100元,超过前代K2.6三倍以上 [7] - 智谱上半年提价后输出价格达到28元 [7] - DeepSeek V4 Pro从6元涨至13.5元,高峰时段27元 [7] - DeepSeek V4 Flash输出价格从2元涨至4.5元,高峰时段9元 [7] - DeepSeek V4 Flash提价后,在OpenCode平台上的调用量下滑了一半,这部分需求成为国产模型厂商新的增长空间 [7] - GLM-5.3-Flash的定价策略瞄准了这一缺口 [7]

智谱新模型“牛来”跑在10万国产卡上,SemiAnalaysis评价“英伟达护城河再受考验” - Reportify