谷歌Gemini 3.8 Flash模型更新 - 谷歌于2026年9月2日推出Gemini 3.8 Flash,定位为“最智能的主力模型”,在软件工程、智能体任务及多步骤推理方面较3.7 Flash有所提升 [3] - 同步推出安全模型Gemini 3.8 Flash Cyber,在漏洞检测和自动修补方面具有前沿性能 [3] - 从3.7 Flash更新到3.8 Flash仅用时14天,模型升级周期显著缩短 [3] - 谷歌DeepMind核心成员姚顺宇表示,对模型而言只是一小步,但对RSI(递归自我改进)是一次巨大飞跃 [3] - 在DeepSWE v1.1评测中,3.8 Flash得分73.7%,仅比Claude Opus 5的74%低0.3个百分点,超过GPT-5.6 Sol的72.7%及上代3.7 Flash的65.3% [6][7] - 根据Artificial Analysis测评,Gemini 3.8 Flash智能得分59,比3.7 Flash高3分,目前排在模型榜单第十位 [7] - API价格维持每百万Token输入0.75美元、输出3.75美元,延续低价普及策略 [7] - 模型能力提升源于底层设计调整,处理复杂任务时执行更多步骤推理并以循环迭代方式调用内部工具 [7] - 每项智能指数任务成本为0.58美元,较3.7 Flash价格上涨约40%,因每任务输出token增加30%及智能体评估回合数增多 [7] - 在高难度任务中模型可能消耗额外Token,旨在提高首次成功率并减少死循环重试和人工干预 [8] - 开发者可通过调整思考配置降低消耗,或继续使用Gemini 3.7 Flash [8] - 谷歌产品逻辑为:旗舰未更新,Flash系列既守成本速度基本盘,也顶上原本旗舰的复杂任务 [8] Meta Muse Spark 1.3模型发布 - Meta于同日推出Muse Spark 1.3,对标Opus 5,在榜单中超过Gemini 3.8 Flash [9] - 升级重点放在Agent长任务、编程及推理效率,强调在较长工作流中持续调用工具、修正计划并处理多个并行任务 [9] - 在DeepSWE v1.1上成绩达75.4%,超过Gemini 3.8 Flash [9] - Meta AI负责人Alexandr Wang在社交媒体调侃谷歌,称“Gemini 是谁”,引发争议 [9][11] - 有网友认为这种明确比较“给人小家子气的感觉” [11] - Meta仅发布模型基准数据,未经开发者实际任务检测,Benchmark胜负不能等同于真实世界胜负 [11] 行业趋势与观察 - AI竞赛时间单位已从季度压缩到周 [12] - 对于开发者而言,发布宣传和榜单排名并不重要,需等待社区应用反馈才能评判模型更新是否成功 [12]
谷歌又发新模型,Meta AI负责人“挑衅”:Gemini是谁啊?