Workflow
单位计算的智能产出
icon
搜索文档
刚刚,Qwen3.8-Flash震撼发布,我们看到了Qwen4的骨架
机器之心· 2026-08-26 21:28
行业趋势:大模型API价格集体上涨与成本结构变化 - DeepSeek V4全系于8月17日启用峰谷分时计费,工作日高峰时段价格减半,闲时价格减半[1] - V4 Flash闲时缓存未命中输入价格上涨约57%,闲时输出上涨约136%,高峰时段输出价格接近旧价的4.7倍[1] - OpenAI、谷歌和Anthropic已相继上调API价格或收缩免费额度,2026年下半年价格曲线集体掉头[2] - 推理需求增长跑赢算力供给增长,Agent将单次调用变成几十次调用,此前靠补贴维持的低价无法持续[3] 行业趋势:模型性价比衡量标准转变 - 大模型切换成本极低,开发者更换底层模型几乎没有迁移负担,性价比一旦落到某条线以下将迅速失去商业存在感[9] - 衡量单位从每百万token价格转变为跑完一项真实任务的每任务成本[10] - Claude Opus 4.8在最大推理档下能力智能得分57分,每任务成本2.03美元;DeepSeek V4 Pro得53分,每任务成本0.25美元;V4 Flash 0731得52分,0.11美元,GPT-5.6 Luna得0.05美元[10] - Claude Sonnet 5的每任务成本为2.29美元,较上一代翻倍,增量全部来自token用量,智能体轮次约为前代的三倍[13] - 多步骤任务成功率约等于各步成功率的连乘,单步95%与90%差五个百分点,二十步后是36%与12%,失败重试需重新支付token[14] 阿里Qwen3.8-Flash产品发布与性能表现 - 阿里发布Qwen3.8-Flash,同步开源Qwen3.8-Flash-Next[4] - 在智能体编程基准DeepSWE 1.1上得分58.7分,参数规模三倍的前代Qwen3.7-Plus仅16.5分[4] - 长周期办公任务CoWorkBench得分73.9,专业岗位任务JobBench得分55.7,高于Claude Opus 4.6的68.2和36.6分[4] - 多模态方面AndroidWorld、ERQA、MathVision等基准大幅领先[4] - HLE得分35.9分落后于Opus 4.6的40.0分,仓库级代码生成NL2Repo-Bench不及DeepSeek-V4-Flash-0731[4] - Qwen3.8-Flash在千问AI平台定价为每百万token输入1元、输出3元,为本月初发布的Qwen3.8-Max的十二分之一,低于DeepSeek V4 Flash调价后闲时价格[6] 阿里Qwen3.8-Flash架构创新:四大技术升级 - Qwen3.8-Flash是一个多模态MoE模型,主模型参数量125B,配备51B的N-gram Embedding,每个token只激活6B参数[27] - 原生支持262,144 token上下文,可通过YaRN扩展至100万token[27] - 新模型用不到前代Qwen3.7-Plus三分之一的激活参数(6B vs 17B),换取相当甚至更强的能力[29] - 注意力机制:Gated DeltaNet(GDN)负责高效记住,Qwen Sparse Attention(QSA)负责精准查找[37] - GDN与Gated Attention按3:1比例交错,四分之三层用线性注意力,四分之一保留标准注意力[32] - QSA在1M token设定下,Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍加速[37] - 在Prefix Cache命中率90%实验设定下,Qwen3.8-Flash在1M上下文下Prefill吞吐达到Qwen3.7-Plus的8.6倍[37] - 残差组件:Gated Residual(GR)将原本单一的residual stream扩展成4条并行分支[42] - 其中一条branch自然形成连接第一层Attention和大部分中后层的长距离通道[42] - N-gram Embedding:额外引入51B参数,以较低成本挂载大规模局部模式记忆库[45] - 51B参数可直接存放在Host Memory中,通过异步Prefetch与模型计算重叠,无需长期占用GPU显存[46] - 架构和优化协同设计:使用Muon优化器训练,针对正交化精度、Muon与AdamW参数分工、融合参数矩阵拆分三个问题工程化[47] - 训练配置直接从目标批量大小开始,Batch Size Warmup不再必要,否则需额外执行18.8%的optimizer steps[52] 阿里Qwen3.8-Flash效率优势与产业信号 - 相比Qwen3.7-Plus,训练开销仅约九分之一[53] - 在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优,其他6个与Qwen3.7-Plus-Base接近[53] - 激活参数只有三分之一、训练开销只有九分之一的模型,在多数预训练评测上追平甚至超过大三倍的前代[54] - 2026年超大规模云厂商推理资本开支历史上第一次超过训练开支,核心矛盾从算力与集群规模变成内存带宽与通信延迟[56] - 2025年1月DeepSeek R1发布后英伟达单日暴跌近17%、市值蒸发约5890亿美元[57] - 2026年4月DeepSeek V4发布时英伟达收涨4.3%,市值重返5万亿美元[57] - 每次任务变便宜后,人们通常把AI部署到更多环节,更便宜的模型可能是推理需求爆发的起点[57] 阿里Qwen3.8-Flash产品定位与未来规划 - Qwen3.8-Flash-Next是Qwen4架构的一次预演[18] - 承担的角色与Qwen3-Next对Qwen3.5的角色一致,是Qwen4所用模型结构的先导预览[20] - 8月3日发布Qwen3.8-Max,总参数2.4T、激活95B,支持约100万token上下文与图像视频输入[21] - 8月14日开源Qwen3.8-27B,登顶Image-to-WebDev竞技场开源模型排行榜[21] - Qwen3.8-Flash承接高频、长期、规模化的真实调用,架构与家族内其他模型大不一样[24] - Qwen3.8-Max基于前代Qwen3.5架构迭代,Qwen3.8-Flash使用全新架构[24] - 新架构先上性价比款而非旗舰,提升目标是单位计算的智能产出[25] - 开放权重已发布至Hugging Face与ModelScope,生产版本已在千问AI平台提供服务[59]