文章核心观点 - 谷歌在领导层交接后,迅速推出Gemini 3.7 Flash模型,以激进的价格策略和性能提升抢占市场,同时其旗舰Pro系列发布延迟,内部战略方向出现分化 [2][5][36] 产品发布与定价策略 - 谷歌在发布3.6 Flash仅三周后,火速推出Gemini 3.7 Flash,这是哈萨比斯交棒Koray后首款公开亮相的Gemini模型 [1][2] - 模型发布时间由新任负责人Koray Kavukcuoglu拍板决定,其策略是优先推出能迅速上线、降低成本并服务大规模产品的模型 [4][39] - 官方宣布年底前3.7 Flash价格腰斩,每百万token输入0.75美元、输出3.75美元,费用仅为3.6 Flash的一半 [6] - 与竞品Grok 4.6相比,Gemini 3.7 Flash价格明显便宜一大截 [6] - 3.7 Flash的API限时价格比初始价格少一半,同时3.6 Flash也降价50% [31] - 半价活动仅持续到年底,2027年1月起输入价格回升至1.50美元,输出价格回升至7.50美元 [32][33] 性能与基准测试表现 - 3.7 Flash在DeepSWE基准测试中提分18.8%,从3.6 Flash的49.0%升至65.3% [7][18] - 在FrontierCode基准测试中,成绩从3.6 Flash的34.4%升至43.6% [18] - 在WebDev Arena上,Elo分数由1538升至1588 [22] - 面向复杂PDF理解的GDP.pdf基准测试从22.0%升至34.0% [26] - 模拟真实企业工作流的AutomationBench上,从17.0%升至30.4% [26] - 在Terminal-bench 2.1上得分85.8%,高于3.6 Flash的78.0% [8] - 在Terminal-bench 3.0上得分14.9%,高于3.6 Flash的5.4% [8] - 在GDM-MRCR v2长上下文测试中,128k平均得分97.0%,高于3.6 Flash的91.8% [8] - 在Harvey LAB-AA复杂法律工作流测试中得分90.7%,高于3.6 Flash的85.1% [8] - 在BioMysteryBench生物信息学推理中,人类可解部分得分87.1%,高于3.6 Flash的80.6% [8] 产品定位与战略方向 - 谷歌将3.7 Flash定位为迄今为止最智能的编码和Agent主力模型 [12] - 谷歌正将Flash系列推向Agent工作流核心,赋予其更强大的工具使用、调试、多步骤执行能力及更少的迭代次数 [13] - 3.7 Flash突出的Agent性能和编码准确率,使其适用于关键编码和网页开发任务 [14] - 新模型遇到障碍时更会切换路径,在意图不清时先确认,再完成多步规划与工具调用 [27] - 以前的Flash追求效率,现在的Flash重心是把事情做完 [28] - 与Grok 4.6对比,Gemini 3.7 Flash建模质量更好,平均推理时间只有Grok的十分之一,费用大幅降低(11.22美元 vs 1.46美元) [16] 行业竞争与内部动态 - 三个月内谷歌接连推出Gemini 3.5 Flash、3.6 Flash和3.7 Flash,但Pro系列仍停在3.1 [34] - OpenAI、Anthropic已发布自家旗舰模型,DeepSeek-V4-Pro也已发布,谷歌面临尴尬局面 [35] - 谷歌靠猛发Flash刷脸,被视为弃车保帅的无奈之举 [36] - Flash和Pro的定位变得模糊,原本Pro负责复杂推理、Flash强调性价比,现在Flash已覆盖更多功能 [37][38] - 哈萨比斯更看重长期研究和能力上限,被放到幕后;接班人Koray Kavukcuoglu则优先推动能快速上线、降本增效的模型 [39] - 两个领导两种画风,谷歌内部战略拉锯刚刚开始 [40]
Token半价!谷歌新模型Gemini 3.7 Flash闪击马斯克Grok