Workflow
Claude Opus 4.8
icon
搜索文档
晚点独家丨智谱推出对标 DeepSeek 的轻量旗舰模型,由 10 万国产卡支持
晚点LatePost· 2026-08-26 23:19
行业竞争格局与市场动态 - 轻量旗舰模型市场迎来新竞争,智谱发布GLM-5.3 Flash,旨在对标DeepSeek V4 Flash [3][4] - 8月DeepSeek V4 Flash提价,证明市场强劲需求,也预示更激烈竞争的到来 [5] - 中国公司自6月以来争相发布能力接近美国次等级闭源模型的产品,包括智谱GLM-5.2、Kimi K3、DeepSeek V4 Pro等 [8] - 在美国,Meta和SpaceXAI等第二梯队公司正瞄准OpenAI和Anthropic的最先进模型,后者价格是中国模型的数十倍 [10] - 中国模型选择多、能力差距小,厂商需与同行、开源部署、云厂商赠送额度竞争,模型难以作为稀缺品定价,更接近标准云服务价格 [10] 智谱GLM-5.3 Flash产品特性 - GLM-5.3 Flash拥有300B参数规模,参数量约为GLM-5.3的40%,与DeepSeek V4 Flash几乎持平 [4] - 采用与GLM-5.3不同的架构设计,具有原生多模态能力,支持图像视频输入,是智谱战略聚焦coding以来第一次推出具有多模态能力的新模型 [4] - 调用超过10万张国产品牌芯片集群用于推理服务,算力供应商或来自华为、摩尔线程与海光 [4] - 全栈适配国产算力,线上流量均由国产芯片承接,智谱在技术文档中表示其集群“硬件效率及单位token成本已经达到了与主流英伟达GPU相当的水平” [8] 性能与定价对比 - 根据智谱内部评测,GLM-5.3 Flash的Artificial Analysis Intelligence分数为57分,超过上一代旗舰模型GLM-5.2,和Claude Opus 4.8持平,高于DeepSeek V4 Pro正式版的53分 [7] - GLM-5.3 Flash每百万token输入0.8元,输出2.8元,缓存命中价格0.23元,正好为GLM-5.3的十分之一 [7] - 横向对比调价后的DeepSeek V4 Flash,其谷时价格分别为输入1.5元、输出4.5元、缓存0.05元,综合输入和输出成本,GLM-5.3 Flash在绝大多数常规调用场景下更便宜 [7] - 上线前两周GLM-5.3 Flash实行半价 [7] - 以Claude Opus 4.8为例,官方输出价格为25美元,而GLM-5.3 Flash海外输出价格则为0.5美元 [10] 市场测试与匿名发布策略 - 正式发布前智谱在OpenRouter等第三方平台以0x Alpha名义测试,5天流量累积超过50T,由于完全免费,刷新了OpenRouter与OpenCode流量增长纪录 [7] - 这不是智谱第一次以匿名形式发布新模型,今年春节前夕OpenRouter上出现名为Pony Alpha的模型,后被证明是智谱的GLM-5模型 [8] 行业定价与需求弹性 - 性能提升同时涨价一度占据叙事主流,Kimi K3输出价格高达100元,超过K2.6三倍多,智谱上半年提价后输出价格也达到28元 [8] - 梁文锋录音中曾表示智能需求没有弹性,DeepSeek只需赚取合理利润,但8月DeepSeek全面提价,DeepSeek V4 Pro从6元涨到13.5元,高峰27元;DeepSeek V4 Flash输出从每百万token 2元涨到4.5元,高峰时段9元,官方理由是算力稀缺 [9] - 事实证明智能能力需求同样有弹性,特别是轻量级旗舰模型,用户对价格敏感 [9] - 涨价后,在OpenCode上DeepSeek V4 Flash模型调用量掉了一半,这部分需求成为国产模型厂商新的增长空间 [9] - 不考虑算力采购与研发成本,模型推理是一门毛利很高的好生意,前提是有足够大的需求与足够用的性能 [10]
智谱发布GLM系列首个原生多模态模型:能力对标Opus 4.8,价格仅其1/40
IPO早知道· 2026-08-26 22:47
核心观点 智谱发布并开源GLM-5.3-Flash模型,以极低成本实现全球前沿智能水平,并通过国产芯片集群验证了大规模推理的经济可行性,标志着前沿模型进入普惠时代 模型性能与定价 - GLM-5.3-Flash总参数320B,能力超越GLM-5.2,在AA综合智能指数中取得57分,与Anthropic的Claude Opus 4.8得分持平[2] - 在自研Z.ai Code Bench体感评估中,编程表现与Claude Opus 4.8相当[2] - 定价为GLM-5.3的1/10,限时折扣内为GLM-5.3的1/20,为Opus 4.8的1/40,实现“同样智力,1/40价格”[4] 架构创新与成本优化 - 全新模型架构专为极低成本设计,总参数量与GLM-4.5相当(355B vs 320B),但激活参数量从32B降至18B,层数从92降至45,几乎减半[8] - 结合智谱最新的30T Token多模态预训练语料,以更少计算资源实现更强性能[8] - 采用稀疏注意力与线性注意力混合架构,为首个开源前沿模型,在保持长上下文能力同时大幅降低服务成本[8] - 采用流形约束超连接提升模型Scaling能力[8] 专业工作能力提升 - 新增视觉理解能力,可检查并优化PPTX、PDF、DOCX和XLSX等Office与文档类任务的输出,具备更强审美判断[9] - 模型能将输出结果与视觉上下文及预期结果对比,实现自我验证和优化,包括更准确的呈现质量评估和审美判断[9] - 针对金融工作,可覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,提供可追溯参考依据[9] - 针对法律工作,可审查合同中的费用、账户与责任条款,按律师惯例批注留痕,并能起草律师函、合同与诉讼文书,格式符合实务规范[9] 国产芯片集群验证 - 发布前以匿名模型Ox-Alpha在OpenCode和OpenRouter进行大规模测试,成为当周最受欢迎模型,创双平台调用量新高,全部流量由国产芯片提供算力支持[8] - 首次在大规模流量中尝试用大国产芯片集群提供服务,芯片通过自研高带宽互联网络连接[10] - 在SGLang基础上构建专用推理引擎,整个构建工作由GLM-5.3驱动的infra agent加速,形成“模型优化系统,系统承载模型”正向循环[10] - 针对国产芯片内存容量与带宽瓶颈,进行激进内存优化,包括以算力换带宽、以通信换显存等定制优化[10] - 技术栈结合节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化及Layer Split等技术[10] - 采用生产级EPD分离式架构,将多模态编码、prompt预填充和逐token解码拆分为独立调度、独立扩缩容的工作池[10] - 与同一硬件初始基线相比,端到端服务性能提升3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平[11]
刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架
机器之心· 2026-08-26 21:28
行业趋势:大模型API价格集体上涨与成本结构变化 - DeepSeek V4全系于8月17日启用峰谷分时计费,工作日高峰时段价格减半,闲时价格减半[1] - V4 Flash闲时缓存未命中输入价格上涨约57%,闲时输出上涨约136%,高峰时段输出价格接近旧价的4.7倍[1] - OpenAI、谷歌和Anthropic已相继上调API价格或收缩免费额度,2026年下半年价格曲线集体掉头[2] - 推理需求增长跑赢算力供给增长,Agent将单次调用变成几十次调用,此前靠补贴维持的低价无法持续[3] 行业趋势:模型性价比衡量标准转变 - 大模型切换成本极低,开发者更换底层模型几乎没有迁移负担,性价比一旦落到某条线以下将迅速失去商业存在感[9] - 衡量单位从每百万token价格转变为跑完一项真实任务的每任务成本[10] - Claude Opus 4.8在最大推理档下能力智能得分57分,每任务成本2.03美元;DeepSeek V4 Pro得53分,每任务成本0.25美元;V4 Flash 0731得52分,0.11美元,GPT-5.6 Luna得0.05美元[10] - Claude Sonnet 5的每任务成本为2.29美元,较上一代翻倍,增量全部来自token用量,智能体轮次约为前代的三倍[13] - 多步骤任务成功率约等于各步成功率的连乘,单步95%与90%差五个百分点,二十步后是36%与12%,失败重试需重新支付token[14] 阿里Qwen3.8-Flash产品发布与性能表现 - 阿里发布Qwen3.8-Flash,同步开源Qwen3.8-Flash-Next[4] - 在智能体编程基准DeepSWE 1.1上得分58.7分,参数规模三倍的前代Qwen3.7-Plus仅16.5分[4] - 长周期办公任务CoWorkBench得分73.9,专业岗位任务JobBench得分55.7,高于Claude Opus 4.6的68.2和36.6分[4] - 多模态方面AndroidWorld、ERQA、MathVision等基准大幅领先[4] - HLE得分35.9分落后于Opus 4.6的40.0分,仓库级代码生成NL2Repo-Bench不及DeepSeek-V4-Flash-0731[4] - Qwen3.8-Flash在千问AI平台定价为每百万token输入1元、输出3元,为本月初发布的Qwen3.8-Max的十二分之一,低于DeepSeek V4 Flash调价后闲时价格[6] 阿里Qwen3.8-Flash架构创新:四大技术升级 - Qwen3.8-Flash是一个多模态MoE模型,主模型参数量125B,配备51B的N-gram Embedding,每个token只激活6B参数[27] - 原生支持262,144 token上下文,可通过YaRN扩展至100万token[27] - 新模型用不到前代Qwen3.7-Plus三分之一的激活参数(6B vs 17B),换取相当甚至更强的能力[29] - 注意力机制:Gated DeltaNet(GDN)负责高效记住,Qwen Sparse Attention(QSA)负责精准查找[37] - GDN与Gated Attention按3:1比例交错,四分之三层用线性注意力,四分之一保留标准注意力[32] - QSA在1M token设定下,Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍加速[37] - 在Prefix Cache命中率90%实验设定下,Qwen3.8-Flash在1M上下文下Prefill吞吐达到Qwen3.7-Plus的8.6倍[37] - 残差组件:Gated Residual(GR)将原本单一的residual stream扩展成4条并行分支[42] - 其中一条branch自然形成连接第一层Attention和大部分中后层的长距离通道[42] - N-gram Embedding:额外引入51B参数,以较低成本挂载大规模局部模式记忆库[45] - 51B参数可直接存放在Host Memory中,通过异步Prefetch与模型计算重叠,无需长期占用GPU显存[46] - 架构和优化协同设计:使用Muon优化器训练,针对正交化精度、Muon与AdamW参数分工、融合参数矩阵拆分三个问题工程化[47] - 训练配置直接从目标批量大小开始,Batch Size Warmup不再必要,否则需额外执行18.8%的optimizer steps[52] 阿里Qwen3.8-Flash效率优势与产业信号 - 相比Qwen3.7-Plus,训练开销仅约九分之一[53] - 在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优,其他6个与Qwen3.7-Plus-Base接近[53] - 激活参数只有三分之一、训练开销只有九分之一的模型,在多数预训练评测上追平甚至超过大三倍的前代[54] - 2026年超大规模云厂商推理资本开支历史上第一次超过训练开支,核心矛盾从算力与集群规模变成内存带宽与通信延迟[56] - 2025年1月DeepSeek R1发布后英伟达单日暴跌近17%、市值蒸发约5890亿美元[57] - 2026年4月DeepSeek V4发布时英伟达收涨4.3%,市值重返5万亿美元[57] - 每次任务变便宜后,人们通常把AI部署到更多环节,更便宜的模型可能是推理需求爆发的起点[57] 阿里Qwen3.8-Flash产品定位与未来规划 - Qwen3.8-Flash-Next是Qwen4架构的一次预演[18] - 承担的角色与Qwen3-Next对Qwen3.5的角色一致,是Qwen4所用模型结构的先导预览[20] - 8月3日发布Qwen3.8-Max,总参数2.4T、激活95B,支持约100万token上下文与图像视频输入[21] - 8月14日开源Qwen3.8-27B,登顶Image-to-WebDev竞技场开源模型排行榜[21] - Qwen3.8-Flash承接高频、长期、规模化的真实调用,架构与家族内其他模型大不一样[24] - Qwen3.8-Max基于前代Qwen3.5架构迭代,Qwen3.8-Flash使用全新架构[24] - 新架构先上性价比款而非旗舰,提升目标是单位计算的智能产出[25] - 开放权重已发布至Hugging Face与ModelScope,生产版本已在千问AI平台提供服务[59]