更多Token、更多芯片!Kimi K3体现“杰文斯悖论”,效率提升反而增加资源消耗
硬AI·2026-07-20 20:38

文章核心观点 - 花旗与美银证券的分析师认为,以Kimi K3为代表的AI模型效率提升与成本降低,并不会导致芯片与内存总需求下降,反而可能因触发“杰文斯悖论”而推高总资源消耗 [2] - 模型更便宜、更高效的关键影响在于可能释放更大的使用量,推动更多AI智能体部署、更长任务链和更多token生成,从而将单位成本下降转化为总资源消耗的增加 [2][4] - 市场竞争加剧,特别是中国开源模型能力逼近,将迫使领先的AI公司增加算力投入以维持优势,进而持续拉动对GPU、HBM、内存及基础设施的需求 [2][11] 低价高性能,触发“杰文斯悖论” - 花旗将Kimi K3视为“杰文斯悖论”的潜在案例,即技术效率提升降低单位成本后,使用量大幅增加导致资源总消耗不降反升 [3][4] - Kimi K3的缓存命中输入价格为每百万token 0.3美元,输出价格为每百万token 15美元,其低成本与高性能组合可能提高开发者调用意愿,推动更多AI智能体部署 [4] - 模型降价不会自动减少硬件需求,智能体任务的连续性和长度增加会将单位成本下降重新转化为总资源消耗,关键在于总token量是否扩大 [4][6] 长上下文推理,把压力传导至内存 - Kimi K3采用Kimi Delta Attention、Attention Residuals和Stable LatentMoE三项关键技术,使其扩展效率达到K2的2.5倍,并支持100万token上下文窗口 [8][9] - 尽管架构优化压低了运行成本,但长上下文和智能体任务会推高KV Cache占用,增加推理端内存负担,运行仍需多节点集群(如超过64颗GPU的超级节点) [9] - 长上下文推理的需求直接关联服务器DDR5和eSSD,DDR5承担高频数据存取,eSSD受益于更大的缓存和数据存储需求 [9] - 对内存厂商而言,关键变量是模型被调用的次数、每次调用生成的token量以及智能体任务链的长度,而非单个模型是否更省算力 [9] 模型逼近,反而抬高算力门槛 - 美银证券认为,更强的中国开源模型(如Kimi K3)不会导致美国AI巨头(如OpenAI、Anthropic、Google)削减算力投入,模型差距收窄反而会提高领先者维持优势的成本 [2][11] - 为守住差异化,领先公司需要依靠更大规模训练、更多强化学习与合成数据循环、更重的测试时推理以及更快的产品发布节奏 [11] - 当模型能力趋同,竞争压力会传导至底层基础设施,包括GPU、HBM、高速网络和推理系统 [11] - 模型竞争加剧的背景下,领先者为保持距离将继续加码算力投入 [11] MoE架构改变瓶颈,显存和互连更重要 - Kimi K3采用的MoE架构使总参数量和每次推理激活的参数分离,降低了部分计算压力,但将基础设施瓶颈转向显存访问、专家路由、响应延迟和互连能力 [12][13] - MoE推理要求系统更高效地搬运数据、调度专家模块并连接更大的计算集群,英伟达提出现代MoE推理需要更大的GPU域 [13] - 英伟达测算显示,其GB300 NVL72在领先开源模型上的每瓦性能最高可达到Hopper平台的25倍 [13] - CoreWeave对Kimi K2.6的测试表明,要在速度和性价比上保持领先,仍需经过优化的英伟达GB300/GB200 NVL72基础设施 [13] - 模型权重可能逐步商品化,但运行模型所需的GPU、高带宽内存、网络互连和推理系统的价值不会消失,随着调用量扩大,这些环节可能成为竞争更集中的地方 [13] Token使用仍在扩张,需求端尚未见顶 - 美银证券引用OpenRouter数据指出,模型调用量仍在快速增加,其中中国AI实验室模型的token使用量已经超过非中国实验室模型 [15][17] - 模型价格下降和能力提升,可能推动调用量继续扩张,而不是被单一模型的效率提升所抵消 [17] - 企业付费使用在增加,截至2026年6月,约55%的美国企业已付费订阅AI模型、平台或工具 [17] - 具体企业采用率:Anthropic为42.4%,OpenAI为39.5% [17] - AI支出高度集中:头部1%的企业用户平均每名员工每月AI支出约4833美元,前10%为516美元,整体中位数仅为11美元 [17] - 分行业与企业规模:科技与媒体行业订阅率达79.8%,大型企业采用率为65.5%,高于中型企业的61.3%和小型企业的48.7% [17] - AI使用仍处于扩散过程,低价模型降低进入门槛后,未来增量需求可能来自更多企业、开发者和智能体应用 [20] 从“更省算力”转向“更多工作负载” - 花旗与美银证券的共同结论是,Kimi K3的意义在于低成本是否释放更大规模的工作负载,而非单一模型是否降低单位推理成本 [21][22] - 花旗认为直接受益方向是服务器DDR5和eSSD,因长上下文、KV Cache和智能体任务会提高内存访问与存储需求 [22] - 美银证券认为更重要的是GPU、HBM、高速网络和推理系统,因为模型竞争会迫使领先者继续投入基础设施 [22] - 美银证券提到,Kimi K3涉及的“45纳米开源EDA”不应被简单解读为商业EDA被替代,在先进制程上,Cadence和Synopsys等商业EDA厂商仍处于关键位置 [22]

更多Token、更多芯片!Kimi K3体现“杰文斯悖论”,效率提升反而增加资源消耗 - Reportify