MoE架构
搜索文档
阿里智谱同日上新,每百万Tokens低至0.8元
21世纪经济报道· 2026-08-27 21:55
核心观点 - 大模型行业竞赛焦点从参数规模转向效率、成本和落地能力,Flash模型成为新方向 [1] - 阿里与智谱同日发布高性价比MoE架构模型,通过稀疏激活等技术大幅降低推理成本 [1][3] - Flash模型正重塑行业商业逻辑,推动价格下降并改写国产模型出海竞争格局 [9] 技术路线与架构 - 阿里Qwen3.8-Flash采用混合专家MoE架构,总参数125B,每Token仅激活6B参数 [1][3] - Qwen3.8-Flash引入GDN与QSA混合注意力机制,在高缓存命中百万Token长上下文场景中提速8倍以上 [3] - 智谱GLM-5.3-Flash总参数320B,单Token激活18B,采用稀疏注意力+线性注意力混合架构 [1][3] - GLM-5.3-Flash是GLM-5系列首个原生多模态基座,具备原生多模态与Agent能力 [1][3] - MoE-Flash从两年前的备选方案变为2026年行业主流,提供接近旗舰的综合能力与数量级推理成本下降 [6][7] 成本与定价 - 阿里Qwen3.8-Flash训练成本较前代Qwen3.7-Plus骤降近90% [3] - 发布次日阿里云降价,输入每百万Tokens 0.8元,输出2.7元 [1][3] - 初始定价输入每百万Tokens 1元、输出3元,最低仅为DeepSeek-V4-Flash的三分之一 [3] - 智谱GLM-5.3-Flash API价格仅为GLM-5.3的十分之一,限时折扣阶段降至二十分之一,约为Claude Opus 4.8的四十分之一 [3] - 成本下降源于稀疏激活、注意力优化、缓存压缩等底层技术,构成可持续成本优势 [9] - MiniMax CEO表示降价与提升毛利率不矛盾,单位Token毛利率正向且持续改善,规模扩大带来更高绝对毛利 [9] 市场表现与竞争格局 - 智谱GLM-5.3-Flash以匿名模型Ox-Alpha在OpenRouter、OpenCode双平台测试登顶并刷新历史纪录,Token调用量达62T [4] - 8月27日港股收盘,智谱全日收涨12.62%,报1160港元/股,最新市值5401亿港元 [4] - 中国模型定价仅为国际顶尖闭源模型的数十分之一 [9] - 据Hugging Face报告,中国开源模型下载占比达41%,首次超过美国,累计下载量突破100亿次 [9] - 中国AI企业通过开源权重策略提升价格竞争力,全球市场价格战迫使美国企业跟进 [10] - OpenAI宣布GPT-5.6 Sol限时促销降价逾20%,为近一个月内第二轮降价,此前GPT-5.6 Luna价格下调80% [10] 行业生态与算力格局 - 腾讯7月发布混元Hy3极致量化版本,总参数量295B,单Token激活21B [7] - DeepSeek持续迭代V4-Flash,依靠MoE架构在代码、长文本领域形成性价比优势 [7] - 海外谷歌Gemini Flash系列长期坚持旗舰能力下探、推理成本下降策略 [7] - 智谱GLM-5.3-Flash是国内前沿大模型首次大规模线上流量完全跑在国产算力之上 [10] - 通过推理系统改造,硬件效率和单Token成本已达到与主流英伟达GPU相当水平 [10] - MoE架构通过稀疏激活降低单Token计算压力,让国产算力有机会承接前沿模型,形成正向循环 [10][11] - Flash模型不会彻底取代稠密旗舰大模型,市场将形成分层格局 [11]