Gemini 3.5 Pro继续跳票,谷歌端上三款Flash模型强行交作业
机器之心·2026-07-22 19:30

谷歌发布三款Flash轻量级模型 - 谷歌未发布备受期待的Gemini 3.5 Pro,而是推出了三款新的Flash轻量级模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和CodeMender中的Gemini 3.5 Flash Cyber [1] - 此次发布的模型旨在满足开发者和企业对更高Token使用效率、更低延迟及更稳定可靠性能的需求,以帮助智能体工作流实现规模化运行 [7] - Gemini 3.6 Flash和Gemini 3.5 Flash-Lite已开放使用,开发者可通过Google AI Studio和Android Studio调用API,Gemini 3.5 Flash-Lite也正在逐步接入Google搜索 [8] - 谷歌同时透露了Gemini 3.5 Pro的进度,称其正在与合作伙伴测试,并已开始推进下一代模型Gemini 4的预训练 [8] Gemini 3.6 Flash模型 - Gemini 3.6 Flash是一款面向主力生产任务的通用模型,在编程、知识工作和多模态任务上的表现相比Gemini 3.5 Flash有进一步提升 [7] - 该模型在效率上全面超过Gemini 3.5 Flash,在Artificial Analysis Index测试中,其输出Token消耗较Gemini 3.5 Flash减少17% [11] - 其定价低于Gemini 3.5 Flash,输入价格为每100万Token 1.50美元,输出价格为每100万Token 7.50美元,有助于降低智能体任务的总体成本 [11] - 在DeepSWE测试中,其得分由37%提升至49%;在MLE Bench测试中,成绩由49.7%提升至63.9% [15] - 在计算机操作能力测试(OSWorld-Verified)上,成绩由78.4%提升至83.0% [15] - 在知识工作领域(GDPval-AA v2测试),得分由1349提高到1421,尤其擅长文档解析、图表与数据分析、报告撰写等多模态任务 [15] Gemini 3.5 Flash-Lite模型 - Gemini 3.5 Flash-Lite是Gemini 3.5系列中速度最快、成本最低的模型,面向低延迟任务及对吞吐量要求高的智能体工作流 [7][19] - 其输出速度达到每秒350个Token,输入价格为每100万Token 0.30美元,输出价格为每100万Token 2.50美元 [20] - 该模型在编程和智能体任务方面实现显著提升:Terminal-Bench 2.1得分由31%提升至54%;GDM-MRCR v2得分由60.1%提升至72.2%;GDPval-AA v2得分由642提升至1140 [22] - 在多项评测中,其表现甚至超过了Gemini 3 Flash,例如SWE-Bench Pro成绩为54.2%(高于Gemini 3 Flash的49.6%),OSWorld-Verified成绩为74.0%(高于后者的65.1%) [25] - 开发者可根据任务需求灵活配置模型的思考等级,以平衡延迟、成本与任务复杂度 [21] CodeMender中的Gemini 3.5 Flash Cyber模型 - Gemini 3.5 Flash Cyber是基于Gemini 3.5 Flash开发、针对网络安全漏洞发现和修复进行专项微调的模型,每个Token的使用成本低于更大规模的模型 [29] - 在CodeMender系统中,多个该模型智能体会协同工作生成整合报告,使其在CyberGym基准测试上取得了接近前沿水平的竞争力表现 [30] - 鉴于该技术的双重用途属性,谷歌采取审慎开放策略,近期将通过CodeMender面向政府机构和受信任的合作伙伴以限量试点方式推出 [32]

Gemini 3.5 Pro继续跳票,谷歌端上三款Flash模型强行交作业 - Reportify