智谱发布GLM系列首个原生多模态模型:能力对标Opus 4.8,价格仅其1/40
IPO早知道·2026-08-26 22:47

核心观点 智谱发布并开源GLM-5.3-Flash模型,以极低成本实现全球前沿智能水平,并通过国产芯片集群验证了大规模推理的经济可行性,标志着前沿模型进入普惠时代 模型性能与定价 - GLM-5.3-Flash总参数320B,能力超越GLM-5.2,在AA综合智能指数中取得57分,与Anthropic的Claude Opus 4.8得分持平[2] - 在自研Z.ai Code Bench体感评估中,编程表现与Claude Opus 4.8相当[2] - 定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40,实现“同样智力,1/40价格”[4] 架构创新与成本优化 - 全新模型架构专为极低成本设计,总参数量与GLM-4.5相当(355B vs 320B),但激活参数量从32B降至18B,层数从92降至45,几乎减半[8] - 结合智谱最新的30T Token多模态预训练语料,以更少计算资源实现更强性能[8] - 采用稀疏注意力与线性注意力混合架构,为首个开源前沿模型,在保持长上下文能力同时大幅降低服务成本[8] - 采用流形约束超连接提升模型Scaling能力[8] 专业工作能力提升 - 新增视觉理解能力,可检查并优化PPTX、PDF、DOCX和XLSX等Office与文档类任务的输出,具备更强审美判断[9] - 模型能将输出结果与视觉上下文及预期结果对比,实现自我验证和优化,包括更准确的呈现质量评估和审美判断[9] - 针对金融工作,可覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,提供可追溯参考依据[9] - 针对法律工作,可审查合同中的费用、账户与责任条款,按律师惯例批注留痕,并能起草律师函、合同与诉讼文书,格式符合实务规范[9] 国产芯片集群验证 - 发布前以匿名模型Ox-Alpha在OpenCode和OpenRouter进行大规模测试,成为当周最受欢迎模型,创双平台调用量新高,全部流量由国产芯片提供算力支持[8] - 首次在大规模流量中尝试用大国产芯片集群提供服务,芯片通过自研高带宽互联网络连接[10] - 在SGLang基础上构建专用推理引擎,整个构建工作由GLM-5.3驱动的infra agent加速,形成“模型优化系统,系统承载模型”正向循环[10] - 针对国产芯片内存容量与带宽瓶颈,进行激进内存优化,包括以算力换带宽、以通信换显存等定制优化[10] - 技术栈结合节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化及Layer Split等技术[10] - 采用生产级EPD分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立调度、独立扩缩容的工作池[10] - 与同一硬件初始基线相比,端到端服务性能提升3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平[11]

智谱发布GLM系列首个原生多模态模型:能力对标Opus 4.8,价格仅其1/40 - Reportify