Workflow
AGI竞赛
icon
搜索文档
谷歌「史上最差」AI模型发布! Gemini 3.5 Pro延期
创业邦· 2026-07-22 14:15
谷歌发布新模型及市场反应 - 谷歌DeepMind宣布推出三款新模型,分别为Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber,而备受期待的Gemini 3.5 Pro正式版并未发布 [2] - 新发布的Gemini 3.6 Flash在Vertex AI上线后口碑遭遇滑铁卢,被用户戏称为「史上最差」模型 [3][12] Gemini 3.6 Flash模型性能表现 - 在前端界面生成能力测试中表现极差,输出的代码逻辑错乱、组件嵌套混乱、交互逻辑断裂,完全无法投入实际使用,在代码竞技场中不敌Meta的Muse Spark 1.1 [14][15][19] - 在空间关系理解测试中频繁出错,对基础位置关系和方向判断的准确率相比Gemini 3.5 Flash明显退步 [20][22] - 在第三方综合测评Artificial Analysis上,Gemini 3.6 Flash得分与3.5 Flash完全相同,表现不如Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra等竞争对手 [34] - 有网友指出其知识截止日期并未更新到声称的2026年3月,实际知识似乎停留在2025年1月,被认为是一个未完成的模型 [36][37] 官方基准测试数据对比 - 根据谷歌发布的测试结果,Gemini 3.6 Flash在多项基准测试中表现如下:在SWE-Bench Pro (Public)上为58.7%,在DeepSWE v1.1上为49%,在Terminal-bench 2.1上为78.0%,在MLE-Bench上为63.9%,在GDPVal-AA v2上Elo评分为1421,在OSWorld-Verified上为83.0%,在CharXiv Reasoning(无工具)上为85.2%,在GDM-MRCR v2(8-needle, 128k average)上为91.8% [34] - 在代码任务上被其他模型超越,仅在视觉和上下文基准测试中持续保持领先水平 [33] 模型定价与性价比 - Gemini 3.6 Flash的输入价格为每百万token 1.50美元,输出价格为每百万token 7.50美元 [34] - 文章指出Gemini 3.6 Flash比Gemini 3.5 Flash、Gemini 3.1 Pro更有「性价比」 [6] - 但同时也指出,与竞争对手相比,其价格更贵且效果更差 [41] 其他发布模型及公司战略 - 同时发布的Gemini 3.5 Flash-Lite主打速度快,每秒可输出350个token,但被质疑快速给出错误答案等于浪费用户时间 [39][40] - 谷歌此次还发布了网络安全模型Gemini 3.5 Flash Cyber [43] - 谷歌在公告中提到Gemini 3.5 Pro还没有完全准备好,而Gemini 4已开始预训练,据CNBC报道这是谷歌「有史以来规模最大的预训练项目」 [47][49] - 有观点认为谷歌陷入了「官僚主义的指标狂热」,为了展示更高的版本号和更快的推理速度而牺牲了AI的真实效用,近期3.5 Pro的开发进展可能不理想 [45][47][48]