昨晚,硅谷经历了AI诸神之战
虎嗅APP·2026-09-03 22:08

文章核心观点 AI的经济学正在发生突变,智能成本正以极快速度下降,核心计量单位正从“每百万token成本”转向“完成一个真实任务的总成本” [11][13][89] 这一趋势由三方面驱动:模型能力下放至低价区间、Agent效率提升以减少无效消耗、以及模型间通信方式的根本性变革 [87][88] 一、Google Gemini 3.8 Flash:前沿能力下放至低价区间 - Google发布Gemini 3.8 Flash,为六周内第三次更新Flash系列,定位为最强大的推理与代码模型 [16][18] - 核心提升集中在long-horizon coding和agentic workflow,在DeepSWE v1.1上取得约74%成绩,一度登顶世界第一 [21][22][25] - 与竞品能力差距缩小:Claude Opus 5约74%,GPT-5.6 Sol约73%,Fable 5约70% [27] - 关键差异在于成本:Gemini 3.8 Flash API输入0.75美元/1M token,输出3.75美元/1M token [30] - DeepSWE单任务平均成本仅2.36美元,而Claude Opus 5为11.84美元,GPT-5.6 Sol为6.46美元 [31][32] - 同一级别软件工程能力,执行成本可差数倍,这在Agent时代至关重要 [35][36] - 模型遇到复杂任务会主动work harder,因token足够便宜,可允许更长运行循环 [38][39] - 核心意义:将过去只有最昂贵frontier model才能提供的能力,压入Flash的价格区间 [40] 二、Meta Muse Spark 1.3:Agent效率提升与成本优化 - Meta发布Muse Spark 1.3,在DeepSWE v1.1上取得75.4%成绩,超越Gemini 3.8 Flash、Claude Opus 5和GPT-5.6 Sol [43][44] - 从1.2到1.3版本,成绩从约55%提升约20个百分点至75.4% [45][46] - 更关键的两个数字:工具调用减少约20%,token消耗减少约25% [48] - 模型强化了在长线程中维护多个workflow、遇到模糊任务主动询问、解决不了主动求助、不可逆操作先确认等能力 [53] - 长任务运行多轮后更不易忘记初始约束,强调模型对自身能力边界的认识 [53][54] - 这些能力在Agent时代可直接换算成钱:Agent少犯一次错误,本身就是一次推理优化 [57][58] - 行业竞争计量单位正从“一百万token多少钱”转向“把一个真实任务从头跑到尾,到底多少钱” [59] 三、Mostik:颠覆性模型间通信方式 - 初创公司Mostik登上WIRED专访,尝试让两个AI模型不再通过自然语言互相交流 [5][62] - 当前Multi-Agent系统低效:模型A生成几百上千token自然语言,模型B再全部读入重新理解 [63] - 类比为“电脑A把文件打印成几百页纸,电脑B用摄像头一页页OCR回去” [64] - Mostik试图在不同模型内部表示间建立Bridge,直接交换latent representation [66] - 实验将完整版GLM-5.2 753B与仅4B的Qwen 3.5桥接,混合系统推理成本仅为完整GLM-5.2的1/20 [68][69] - 挑战在于不同模型架构、参数、训练数据和内部坐标系不同,缺乏成熟数学语言描述共同表示 [71][72] - 1/20的数字引发对未来AI架构的思考:设备端可能只需运行0.xB或几B的小模型 [73][77][78] - 小模型负责高频廉价持续运行,云端frontier model负责低频困难推理,中间通过Bridge高效通信 [82] - 未来可能只需传输高度压缩的latent state,而非重新发送十万token的Context [80][81] - 推理成本下降幅度可能远超今天API降价30%或50%,将改变组织AI计算的方式 [83][84] 四、行业趋势与影响 - 智能正以非常夸张的速度变得便宜,降价已不止API单价下降 [89][90] - 模型价格下降、完成任务所需计算量下降、模型间信息交换方式被重新设计 [90] - 技术真正爆发发生在“终于便宜到可以随便用”的时候 [92] - 今天Agent花几十美元完成小任务不划算,未来只需几毛钱,许多应用将成立 [93][94] - 今天不可能让几十个Agent 24小时围绕一个人运行,推理成本再下降一两个数量级可能成为默认状态 [95]

昨晚,硅谷经历了AI诸神之战 - Reportify