刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃
机器之心·2026-09-03 06:34

核心观点 - 谷歌在六周内推出第三款Flash系列模型Gemini 3.8,包含通用版和网络安全专用版,在保持成本优势的同时显著提升推理、代码和Agent能力 [1][4][6] 模型版本与定位 - Gemini 3.8 Flash定位为高智能通用工作模型,重点强化软件工程、Agent任务及复杂多步推理 [4] - Gemini 3.8 Flash Cyber是谷歌目前能力最强的网络安全模型之一,专注漏洞发现和自动化补丁修复 [6] - 两个版本基于同一底层模型能力,通过长期运行的Agent循环机制增强表现 [7] 定价与成本优势 - Gemini 3.8 Flash输入Token每百万0.75美元,输出Token每百万3.75美元,与Gemini 3.7 Flash相同 [5] - 对比Claude Opus 5输入每百万5美元、输出每百万25美元,成本仅为后者的15% [10] - 对比GPT-5.6 Sol输入每百万4美元、输出每百万20美元,成本优势明显 [10] 性能提升与基准测试 - DeepSWE v1.1长周期软件工程测试中Gemini 3.8 Flash达73.7%,超过Gemini 3.7 Flash的65.3%和Claude Sonnet 5的53.8% [10] - Terminal-bench 2.1终端编码测试达89.4%,超过Gemini 3.7 Flash的85.8%和Claude Opus 5的89.1% [10] - Terminal-bench 4.0通用Agent能力达19.1%,较Gemini 3.7 Flash的11.2%提升显著 [10] - HLE-Verified多学科专家推理测试达54.9%,超过Gemini 3.7 Flash的53.6%和Claude Opus 5的54.4% [10][13] - CharXiv复杂图表推理测试达86.2%,超过Gemini 3.7 Flash的84.5%和Claude Opus 5的83.7% [10] - LVBench长视频理解测试达87.8%,超过Gemini 3.7 Flash的85.4% [10] - OSWorld-2.0 Agentic计算机使用测试达59.0%,超过Gemini 3.7 Flash的50.6% [10] 专业领域应用 - Vals Finance Agent v2金融分析任务达61.4%,超过Gemini 3.7 Flash的59.0%和Claude Opus 5的58.6% [10][13] - Harvey法律Agent基准测试通过率10.0%,超过Gemini 3.7 Flash的8.8%和Claude Opus 5的6.7% [10][13] - BioMysteryBench生物信息学Human Difficult测试达56.5%,超过Gemini 3.7 Flash的43.5%和Claude Opus 5的49.4% [10] - LABBench2生物学研究任务达86.2%,超过Gemini 3.7 Flash的82.1% [10] 技术实现机制 - 性能提升源于投入更多计算量完成任务,模型执行更多推理步骤并反复调用工具 [17] - 在更高推理强度设置下可能消耗更多Token,开发者可选择较低推理强度或继续使用Gemini 3.7 Flash [17] 网络安全专用模型 - CyberGym漏洞发现基准测试中,Gemini 3.8 Flash Cyber展现前沿水平的自主漏洞发现能力 [19] - 内部基准测试覆盖20种编程语言,漏洞发现成功率超过70% [25][26] - CWE-Bench补丁修复测试中Pass@1成功率达47.2%,接近领先前沿模型的47.8%但成本显著更低 [30] - Chrome安全团队发现该模型为Chrome漏洞生成的正确修复补丁数量比规模更大的商业模型提升2.6倍 [35] - Wiz内部渗透测试中漏洞发现召回率提升7.5%至9.7%,成本降低2.3至5.2倍 [35] - Google云漏洞研究团队利用该模型在不到2小时内发现关键基础漏洞,此前通常需要数月 [35] 行业影响与评价 - Aigora.ai CEO称Gemini 3.8 Flash具备Opus 5级别的代码质量,但成本只需一小部分且速度非常快 [8] - 谷歌DeepMind核心成员表示这对递归自我改进是一次巨大飞跃 [7] - 谷歌已开始使用Gemini 3.8 Flash Cyber保护公司内部代码安全 [31]

刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃 - Reportify