Gemini 3.8 Flash Cyber
搜索文档
谷歌又发新模型,Meta AI负责人“挑衅”:Gemini是谁啊?
第一财经· 2026-09-03 22:41
谷歌Gemini 3.8 Flash模型更新 - 谷歌于2026年9月2日推出Gemini 3.8 Flash,定位为“最智能的主力模型”,在软件工程、智能体任务及多步骤推理方面较3.7 Flash有所提升 [3] - 同步推出安全模型Gemini 3.8 Flash Cyber,在漏洞检测和自动修补方面具有前沿性能 [3] - 从3.7 Flash更新到3.8 Flash仅用时14天,模型升级周期显著缩短 [3] - 谷歌DeepMind核心成员姚顺宇表示,对模型而言只是一小步,但对RSI(递归自我改进)是一次巨大飞跃 [3] - 在DeepSWE v1.1评测中,3.8 Flash得分73.7%,仅比Claude Opus 5的74%低0.3个百分点,超过GPT-5.6 Sol的72.7%及上代3.7 Flash的65.3% [6][7] - 根据Artificial Analysis测评,Gemini 3.8 Flash智能得分59,比3.7 Flash高3分,目前排在模型榜单第十位 [7] - API价格维持每百万Token输入0.75美元、输出3.75美元,延续低价普及策略 [7] - 模型能力提升源于底层设计调整,处理复杂任务时执行更多步骤推理并以循环迭代方式调用内部工具 [7] - 每项智能指数任务成本为0.58美元,较3.7 Flash价格上涨约40%,因每任务输出token增加30%及智能体评估回合数增多 [7] - 在高难度任务中模型可能消耗额外Token,旨在提高首次成功率并减少死循环重试和人工干预 [8] - 开发者可通过调整思考配置降低消耗,或继续使用Gemini 3.7 Flash [8] - 谷歌产品逻辑为:旗舰未更新,Flash系列既守成本速度基本盘,也顶上原本旗舰的复杂任务 [8] Meta Muse Spark 1.3模型发布 - Meta于同日推出Muse Spark 1.3,对标Opus 5,在榜单中超过Gemini 3.8 Flash [9] - 升级重点放在Agent长任务、编程及推理效率,强调在较长工作流中持续调用工具、修正计划并处理多个并行任务 [9] - 在DeepSWE v1.1上成绩达75.4%,超过Gemini 3.8 Flash [9] - Meta AI负责人Alexandr Wang在社交媒体调侃谷歌,称“Gemini 是谁”,引发争议 [9][11] - 有网友认为这种明确比较“给人小家子气的感觉” [11] - Meta仅发布模型基准数据,未经开发者实际任务检测,Benchmark胜负不能等同于真实世界胜负 [11] 行业趋势与观察 - AI竞赛时间单位已从季度压缩到周 [12] - 对于开发者而言,发布宣传和榜单排名并不重要,需等待社区应用反馈才能评判模型更新是否成功 [12]
Google starts September with AI momentum after longest monthly losing streak in over a decade
CNBC· 2026-09-03 11:28
公司近期动态与市场背景 - 谷歌结束了在华尔街超过十年的最长月度连跌后,9月初为投资者提供了几个乐观理由 [1] - 公司股价在周三上涨0.6%,但周二下跌超过1%,9月至今仍小幅下跌 [3] - 这些进展为Alphabet在经历了一个艰难的夏季后提供了更具建设性的前景,此前谷歌在AI模型竞赛中失去了一些势头,经历了DeepMind内部重大重组和高管人才流失 [3] 产品发布与技术进展 - 公司于周三发布了Gemini 3.8 Flash,这是六周内的第三个Flash模型,同时推出了针对政府和企业客户的新网络安全模型 [2] - Gemini 3.8 Flash专注于编码和代理任务,这是AI公司正试图将技术进步转化为企业收入的两个领域 [4] - 谷歌称Gemini 3.8 Flash是其迄今为止最好的推理和编码模型,在软件工程和多步骤任务上较3.7 Flash有显著改进 [4] - Google DeepMind产品管理高级总监Tulsee Doshi表示,最近的Flash模型在性能上“确实以积极的方式让我们感到惊讶”,并提供了“深入利用它们的机会” [5] - 较小的Flash模型运行成本更低,迭代速度更快,同时在部分任务上越来越接近大型前沿系统 [8] - D.A. Davidson分析师Gil Luria认为,从产品角度看,该模型让谷歌保持在竞赛中,但可能不会改变其在企业市场“遥远第三”的事实 [8] 定价策略与市场竞争 - Gemini 3.8 Flash定价为每百万输入token 75美分,每百万输出token 3.75美元,与上一代Flash模型价格相同,尽管新模型在编码、代理任务和推理方面有所改进 [9] - Gemini Enterprise新增按需付费定价、高达20%的token折扣、代理支出月度上限以及零美元基础订阅选项 [10] - 谷歌直接针对微软和Anthropic,声称其经常性席位费用和单独产品许可使其产品更昂贵且灵活性更低 [10] - 近四分之三的Google Cloud客户已在使用其AI产品,这些客户的支出比原始承诺高出约50% [11] - DeepMind的Demis Hassabis描述了一个未来,Gemini可作为通用层协调更便宜的专业模型和代理,在该场景中广度可能与拥有最佳模型同等重要 [12] 网络安全与政府合作 - 谷歌表示Gemini 3.8 Flash Cyber能够以前沿级性能检测和修补软件漏洞,同时运行速度更快、成本更低 [13] - Doshi表示公司很高兴能够以“一小部分成本、更快速度”为防御者提供前沿级性能的解决方案 [14] - 由于这些能力可能被滥用,谷歌通过新的Fairwind Program初步限制访问权限,仅面向一小部分受信任的政府和企业防御者 [14] 外部支持与法律胜利 - 伯克希尔哈撒韦CEO Greg Abel公开表达了对Alphabet AI地位的信心,称其从旗下公司使用AI的方式和收益中看到了谷歌作为重要参与者的价值 [2][17] - 一名联邦法官驳回了司法部要求谷歌出售其广告交易所AdX的请求,选择了行为补救措施而非监管机构寻求的结构性拆分 [2][19] - 该裁决是继去年另一项反垄断裁决后,法院再次拒绝强制谷歌剥离Chrome [19] - 反垄断律师Wyatt Fore表示,两起案件法院都选择不拆分公司是“大事”,谷歌正“没有双手被绑在背后”地进入AI竞赛 [20] 财务与投资背景 - 尽管部分市场专家认为谷歌在AI领域的地位不稳,但其广告业务持续增长,最新季度增长了14% [18] - Alphabet在AI基础设施上投入巨额资金,公司依赖增长和市场份额提升来在长期内带来回报 [15]
谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
量子位· 2026-09-03 08:32
核心观点 - 谷歌发布Gemini 3.8 Flash,Coding能力大幅提升,在LMArena Agent榜单空降第14名,以微弱优势险胜DeepSeek-V4-Pro[2] - 该模型定价与3.7 Flash保持一致,未涨价[4][5] - 谷歌采用“多步骤循环”策略弥补模型智能不足,与OpenAI和Anthropic追求更少步骤完成任务的路径不同[9][10][11] - 3.8 Flash是市面上输出最快的模型,速度比第二名Meta高近一倍[14] - 谷歌六周内连出三款Flash模型,人事变动频繁,包括二进制能力拥有者Jeff Dean离职[21] - 同时Meta发布Muse Spark 1.3,对标Opus 5,Agent和Coding能力大幅提升[50] 性能与基准测试 - DeepSWE v1.1长周期软件工程任务得分73.7%,高于3.7 Flash的65.3%,接近Claude Opus 5的74.0%[27] - Terminal-bench 2.1 Agentic终端编码得分89.4%,高于3.7 Flash的85.8%[20] - Terminal-bench 4.0通用Agent能力得分19.1%,高于3.7 Flash的11.2%,但远低于Claude Opus 5的51.8%和GPT-5.6 Sol的37.3%[20] - HLE-Verified多学科专家推理得分54.9%,高于3.7 Flash的53.6%[27] - CharXiv复杂图表推理得分86.2%,高于3.7 Flash的84.5%[27] - LVBench长视频理解得分87.8%(Agentic模式)和87.1%(静态模式),高于3.7 Flash的85.4%[27] - OSWorld-2.0 Agentic计算机使用得分59.0%,高于3.7 Flash的50.6%[27] - BioMysteryBench生物信息学研究工作流Human Solvable得分88.8%,Human Difficult得分56.5%,均高于3.7 Flash的87.1%和43.5%[27] - LABBench2生物学真实研究任务得分86.2%,高于3.7 Flash的82.1%[27] - GDP.PDF Expert PDF文档理解得分35.0%,略高于3.7 Flash的34.0%[27] 企业级Agent场景 - 金融领域Vals Finance Agent v2得分61.4%,高于3.7 Flash的59.0%,并超过Claude Opus 5的58.6%和GPT-5.6 Sol的53.8%[27] - 法律领域Harvey's Legal Agent Benchmark复杂法律工作流全部通过率10.0%,高于3.7 Flash的8.8%,并超过Claude Opus 5的6.7%和GPT-5.6 Sol的2.5%[27] - GDPVal-AA v2知识工作Elo评分1545,高于3.7 Flash的1482[27] 定价与成本 - 输入价格$0.75/百万Token(常规$1.50),输出价格$3.75/百万Token(常规$7.50),与3.7 Flash一致[27] - 相比Claude Opus 5输入$5.00/百万Token、输出$25.00/百万Token,成本优势显著[27] - 相比GPT-5.6 Sol输入$4.00/百万Token、输出$20.00/百万Token,成本更低[27] 网络安全模型3.8 Flash Cyber - 谷歌史上最强网络安全模型,专攻自主发现漏洞和自动生成补丁[38] - CyberGym漏洞发现测试超过3.5 Flash Cyber和其他前沿模型[38] - 覆盖20种编程语言的内部代码库测试,挖洞成功率超过70%[38] - CWE-Bench修洞pass@1达到47.2%,接近前沿模型的47.8%,成本低出一大截[42] - Chrome安全团队使用后,产出的正确补丁数量是最强商业模型的2.6倍[45] - Wiz内部渗透测试召回率提升7.5到9.7个百分点,花费仅为其他前沿模型的2.3到5.2分之一[46] - Google Cloud漏洞研究团队不到两小时挖出以往需研究数月的关键基础漏洞[47] - 该模型不公开发布,仅通过Fairwind计划向受信防御者开放[48][49] 潜在风险与争议 - 有网友指出模型在Terminal-bench 4.0等新基准上表现不佳,怀疑是刷分结果[19] - 智能方面未见本质提升,高分可能依赖多步骤推理和反复迭代调用工具,消耗更多Token[31][32][33] - 实际使用效果存疑,若智能水平不足,可能输出大量劣质Token[15][16]
8点1氪:星宇董事长就解约应届生致歉;中一签或赚28万,燧原科技中签率公布;苹果新任CEO薪酬公布,略高于前任库克
36氪· 2026-09-03 08:04
星宇股份用工事件回应 - 星宇股份董事长周晓萍就近期“解约应届生”舆情公开回应,公司已发布致歉信并正在政府部门指导下妥善落实相关措施 [2] - 周晓萍对披露真实情况的媒体监督表示衷心感谢,公司深刻反省并真诚道歉 [2] - 公司对部分媒体的不实报道已通过网信和网安部门进行投诉和举报,以维护公司合法权益 [2] 燧原科技IPO与国产GPU - 燧原科技披露科创板上市网上发行申购情况及中签率,本次发行股份数量为4303.5173万股,发行价142.18元/股 [4] - 网上发行有效申购户数703.2045万户,有效申购股数420.66亿股,因申购倍数超100倍启动回拨机制,最终中签率0.02455315% [4] - 燧原科技与摩尔线、沐曦股份、壁仞科技并称“国产GPU四小龙”,摩尔线程、沐曦股份上市首日收盘涨幅分别超425%和692% [4] - 若燧原科技上市首日涨幅超400%,中一签浮盈将超28万元 [4] 苹果公司人事与薪酬 - 苹果公司计划向新任CEO约翰·特努斯支付300万美元年薪,外加2027财年目标年度股票奖励5500万美元 [4] - 2025财年,前任CEO库克基本年薪300万美元及5000万美元股票奖励,最终实际薪酬约7430万美元,含1200万美元非股权激励和176万美元其他薪酬 [4] - 苹果官方X账号已取关蒂姆·库克,仅关注新任CEO约翰·特努斯 [4] OpenAI下一代模型发布 - OpenAI计划尽快发布下一代AI模型Astra,该模型是首个达到“关键”网络安全能力门槛的AI模型,将限制使用范围 [5] - Astra能发现此前未知的安全漏洞,并在无需人类逐步指导的情况下利用漏洞并发起攻击 [5] - Astra在ExploitBench测试中取得满分,该测试评估大语言模型利用已知系统漏洞实施攻击的能力 [5] 谷歌发布Gemini 3.8 Flash系列 - 谷歌正式推出Gemini 3.8 Flash及面向网络安全场景的Gemini 3.8 Flash Cyber,为六周内第三款Flash版本模型 [5] - 模型输入成本0.75美元/百万Tokens,输出3.75美元/百万Tokens,单任务成本0.58美元,生成速度达305 tokens/s [6] - 基准测试智力指数59分,软件工程测试DeepSWE v1.1取得73.7%成绩,综合表现逼近GPT-5.6 Sol、Opus 5等旗舰模型 [6] - 安全专项版本Gemini 3.8 Flash Cyber漏洞挖掘能力大幅领先,实测两小时即可发现高危漏洞,不对公众完全开源,仅对可信机构开放 [6] 英伟达拟收购Hugging Face - 英伟达正深入谈判拟以近140亿美元收购AI开源平台Hugging Face,若达成将为2025年全球AI领域最高金额收购案 [6] - 交易包含129亿美元现金对价与10亿美元核心员工留任激励,条款仍有调整空间,或于本周敲定 [6] - Hugging Face被誉为“AI界GitHub”,坐拥超1300万全球开发者、300万个开源AI模型,年化营收约1.5亿美元 [7] - 英伟达2023年已参投其D轮融资,本次收购报价较彼时估值涨幅近三倍 [7] 腾讯WorkBuddy开放平台上线 - 腾讯WorkBuddy宣布开放平台正式上线,首批引入超百家生态伙伴,面向智能硬件、行业应用与开发者开放底层Agent能力 [7] - 发布会现场9款联名智能硬件首发亮相,合作方包括Plaud、Rokid、影石、科大讯飞、安克、猛玛、京东京造等品牌 [7] - 30余个行业应用同步接入,覆盖金融、法律、医疗、教育、公益等20多个领域 [7] Kimi API支持新格式 - 月之暗面宣布Kimi API现已支持OpenAI的Responses API格式和Anthropic的Messages API格式 [8] - 使用Codex或Claude Code的用户可通过自定义模型提供商直连kimi-k3、kimi-k2.7-code-highspeed、kimi-k2.7-code、kimi-k2.6等模型 [8] 马斯克预告Grok 4.7模型 - 马斯克在X平台预告10天后发布Grok 4.7模型,参数规模达2.1万亿,较Grok 4.6的1.5万亿增长40% [8] 智谱入驻天猫开启Token零售 - 智谱开设天猫官方旗舰店,上线GLM Coding Plan系列订阅套餐,面向个人及中小团队零售AI编程服务,支持月、季、年订阅 [8] - 套餐价格大幅上调,Pro版月费从149元涨至538元,涨幅达3.6倍,新版升级为GLM-5.3模型,采用积分制计费 [8] - 此次入驻标志国内大模型厂商正式开启Token大众化零售模式,智谱正加速商业化转型,API业务已成为核心营收支柱 [8] 追觅回应放弃整车量产 - 追觅科技确认终止“星空计划”整车量产项目,汽车业务整体并入产业研究院,仅保留电机、底盘控制等底层技术储备 [9] - 公司主动战略纠偏,将200余个业务单元整合为智能家庭、户外庭院、智能出行、具身智能四大主业 [9] - 同步收缩关停MOVA品牌重叠业务、手机等多项跨界孵化项目,集中资源夯实核心主业 [9] - 追觅表示将妥善承接供应商合同与账款事宜,建立专项处理机制 [9] 猛玛与WorkBuddy达成生态合作 - 腾讯WorkBuddy宣布与专业音视频硬件品牌HOLLYLAND猛玛达成深度生态合作,推出猛玛LARK A2无线麦克风WorkBuddy联名款 [9] - 该产品为首款原生联动WorkBuddy智能体的AI语音入口,用户通过麦克风机身按键即可唤醒语音输入、删除内容并发送指令 [9] 本田中国回应供应商降价要求 - 有消息称本田已向供应商下达指令,要求将部分关键零部件成本削减30%,包括软件定义汽车相关零部件 [10] - 本田中国回应称“这不是Honda官方发布的内容”,公司一直致力于与供应商共同创新合作,持续开展成本优化活动 [10] 字节跳动上调期权价格 - 字节跳动调整期权价格,在职员工从229.5美元/股调整至241.35美元/股,涨幅约5.1% [10] - 这是2026年以来字节第二次调整期权价格,上一次在今年4月从200.41美元/股调整为229.5美元/股 [10] Minimax成为内地投资者新宠 - Minimax Group Inc成为上月内地投资者最青睐的港股,8月内地投资者通过港股通买入价值106亿港元的Minimax股票 [11] - 买入规模超过阿里巴巴和腾讯控股,自8月6日被纳入港股通以来,南向投资者已累计持有该AI初创企业9.7%的股份 [11] 微信灰度测试新功能 - 新版微信新增2个功能:长按左下角“微信”可查看当前全部未读聊天(正在灰度中) [11] - 聊天中有未领取的红包及转账时,聊天框右上角会出现“红包”“转账”提醒 [11] 全球数据中心资本支出预测 - 普华永道预计2026年至2050年间全球数据中心资本支出或将达到31.6万亿美元 [11] - 如果人工智能普及速度加快,潜在增幅可达50万亿美元 [11] - 人工智能基础设施建设周期每四到六年重置一次,预期支出将超过美国和英国铁路扩建及互联网建设成本总和 [11] 欧盟首次AI执法行动 - 欧盟委员会依据《人工智能法案》向30余家AI企业发送信息调查请求,为法案执法权力生效以来首次正式执法行动 [12] - 信息请求涉及AI系统安全性和版权合规两大核心问题,属于正式调查前的初步步骤 [12] - 收到请求的企业如提交不正确、不完整或具误导性回复,可能面临最高1500万欧元或全球年营业额3%的罚款 [12] SK海力士资金汇回与韩国干预 - SK海力士7月发行265亿美元美国存托凭证后,韩国外汇当局购买了约200亿美元SK海力士汇回的资金 [12] - 韩国外汇稳定基金通过场外交易购汇 [12] 特朗普家族投资Polymarket - 美国总统特朗普之子小唐纳德·特朗普旗下风险投资公司1789 Capital领投预测市场Polymarket新一轮融资 [12] - 预计投资约3亿美元,即将成为其最大投资方之一,该轮估值达210亿美元 [12] G20财长会议未发表公报 - 8月31日至9月1日举办的G20财长和央行行长会议因各方分歧未能发布会议公报 [13] - 中方表示自美国接任2026年G20主席国以来始终积极、建设性参与议题讨论,对未能发表公报深表遗憾 [13] - 中方强调G20应恪守协商一致、平等参与原则,期待美方及各成员推动2026年G20迈阿密峰会取得积极成果 [13] AI调用价格大幅跳水 - AI调用单价指数创历史新低,较今年夏季高点近乎腰斩,用户和企业使用大模型成本大幅下降 [14] - 本轮降价源于行业激烈内卷,国内Kimi等高性价比AI模型低价优势倒逼OpenAI等海外巨头跟进降价 [14] - 价格下跌利好普通用户但大幅压缩AI企业利润,行业出现明显“增收不增利”困境 [14] - 业内指出AI行业单纯比拼模型性能的时代结束,未来将转向差异化赛道竞争 [14] 雀巢出售保健品业务 - 雀巢集团以10亿美元代价出售旗下主流维生素、矿物质和补充剂业务,涉及7个品牌 [14] - 交易涉及Nature's Bounty、Osteo Bi-Flex、Ester-C、Gard、Nuun、Puritan's Pride和Sisu等品牌及相关美国自有品牌补充剂业务 [14] - 业务主要位于美国,同时在加拿大和中国等多国布局,交易预计2027年上半年完成 [14] - 接手方为总部位于美国波士顿的私募股权公司Yellow Wood Partners [14] 《富爸爸穷爸爸》作者负债争议 - 畅销书作者罗伯特·清崎宣称自己“负债12亿美元”,其前妻金·清崎表示该数字为与合作伙伴共同持有的房地产项目债务总额 [15] - 清崎与合作伙伴持有约1500套公寓,清崎本人承担的份额要小得多 [15] “易中天”概念股下挫 - 9月2日早盘“易中天”集体下挫,新易盛、中际旭创、天孚通信盘中均跌超5%,中际旭创总市值跌破1万亿元 [15] - 截至下午收盘跌幅收窄,新易盛跌4.00%,天孚通信收跌0.70%,中际旭创跌4.29%,最新市值9709亿元 [15] 伯克希尔投资Alphabet - 伯克希尔哈撒韦CEO阿贝尔证实巴菲特主导了伯克希尔对Alphabet的投资,动因在于该公司的人工智能优势 [15] - 阿贝尔认为人工智能数据中心对伯克希尔哈撒韦能源公司而言是一项重大机遇 [15] 美股三大指数收涨 - 9月2日美股三大指数集体上涨,纳指涨0.45%,标普500涨0.46%,道指涨0.56% [16] - 大型科技股多数上涨,英伟达涨超3%,Meta涨超2%,谷歌、特斯拉、亚马逊小幅上涨,微软、苹果小幅下跌 [16] - 热门中概股普跌,蔚来跌近5%,哔哩哔哩跌超2%,拼多多跌超1%,小鹏集团、百度、网易、京东小幅下跌,理想汽车涨0.92% [16] 黑石投资网络安全初创企业 - 黑石集团对初创网络安全公司Huskeys进行早期押注,该公司打造AI网关防护系统应对自动化网络流量风险 [17] - 黑石创新投资领投2700万美元A轮融资,这家成立仅一年的公司投后估值超1亿美元 [17] - 交易完成后黑石成为该公司第二大外部投资方,仅次于以色列风投机构10D [17] 天目先导启动IPO辅导 - 溧阳天目先导电池材料科技股份有限公司于2026年9月1日办理辅导备案登记,拟首次公开发行股票并上市,辅导券商为中信证券 [19] - 公司无控股股东,罗飞直接持股2.34%,通过持股平台合计控制19.08%股份,直接、间接控制21.42%股份,为公司实际控制人 [19] “鼎犀智创”完成Pre-A轮融资 - AI新材料研发公司“鼎犀智创”完成数亿元Pre-A轮融资,由鼎晖百孚领投,九合创投、彬复资本、龙芯创投、顺禧基金、中关村资本跟投 [20] - 资金将重点用于RhinoMat材料科学基础大模型及底层技术研发、多场景可编排AI智能体与自主进化实验室体系建设、碳基高性能材料放大验证 [20] “天工机器人”完成融资 - 北京天下先智创机器人技术有限责任公司(天工机器人)完成数亿元融资,由初芯基金领投,经纬创投、合肥国资等跟投 [21] - 资金将重点用于分拣类机器人扩大量产规模、基于人形的分拣机器人研发与商用化迭代及海外市场业务拓展 [21] AI初创公司Cognition拟融资 - 人工智能初创公司Cognition据悉拟融资约10亿美元,估值达470亿美元 [22] “Heygo”完成天使融资 - 由前字节、大疆、腾讯青年创业团队成立的“Heygo”完成第一轮数百万美金天使融资,由厚雪机构独家投资 [22] - Heygo在2025年正式成立,曾推出一款针对单板滑雪的AI硬件 [22] 京沪高铁半年报业绩 - 京沪高铁披露2026年半年报,上半年实现营业收入218.42亿元,同比增长3.94% [23] - 归母净利润和扣非净利润均为67.71亿元,均同比增长7.21%,高于同期国泰航空62.43亿港元的最高盈利水平 [23] - 第二季度录得净利润36.28亿元,环比一季度增长14.7% [23] - 业绩增长得益于客流攀升、票价上浮及财务费用优化,京沪高铁是国铁集团核心盈利支柱 [23] 戴森推出AI智能牙刷 - 戴森推出首款内置摄像头的智能电动牙刷CameraJet,售价499美元,国行价3899元 [24] - 刷头内置高清微型摄像头,拍摄图像由AI分析后能识别牙菌斑分布和牙龈状态,提供实时清洁指导 [24] - 通过与配套手机应用连接,可生成用户口腔健康地图,标注需要重点清洁的区域 [24]
刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃
机器之心· 2026-09-03 06:34
核心观点 - 谷歌在六周内推出第三款Flash系列模型Gemini 3.8,包含通用版和网络安全专用版,在保持成本优势的同时显著提升推理、代码和Agent能力 [1][4][6] 模型版本与定位 - Gemini 3.8 Flash定位为高智能通用工作模型,重点强化软件工程、Agent任务及复杂多步推理 [4] - Gemini 3.8 Flash Cyber是谷歌目前能力最强的网络安全模型之一,专注漏洞发现和自动化补丁修复 [6] - 两个版本基于同一底层模型能力,通过长期运行的Agent循环机制增强表现 [7] 定价与成本优势 - Gemini 3.8 Flash输入Token每百万0.75美元,输出Token每百万3.75美元,与Gemini 3.7 Flash相同 [5] - 对比Claude Opus 5输入每百万5美元、输出每百万25美元,成本仅为后者的15% [10] - 对比GPT-5.6 Sol输入每百万4美元、输出每百万20美元,成本优势明显 [10] 性能提升与基准测试 - DeepSWE v1.1长周期软件工程测试中Gemini 3.8 Flash达73.7%,超过Gemini 3.7 Flash的65.3%和Claude Sonnet 5的53.8% [10] - Terminal-bench 2.1终端编码测试达89.4%,超过Gemini 3.7 Flash的85.8%和Claude Opus 5的89.1% [10] - Terminal-bench 4.0通用Agent能力达19.1%,较Gemini 3.7 Flash的11.2%提升显著 [10] - HLE-Verified多学科专家推理测试达54.9%,超过Gemini 3.7 Flash的53.6%和Claude Opus 5的54.4% [10][13] - CharXiv复杂图表推理测试达86.2%,超过Gemini 3.7 Flash的84.5%和Claude Opus 5的83.7% [10] - LVBench长视频理解测试达87.8%,超过Gemini 3.7 Flash的85.4% [10] - OSWorld-2.0 Agentic计算机使用测试达59.0%,超过Gemini 3.7 Flash的50.6% [10] 专业领域应用 - Vals Finance Agent v2金融分析任务达61.4%,超过Gemini 3.7 Flash的59.0%和Claude Opus 5的58.6% [10][13] - Harvey法律Agent基准测试通过率10.0%,超过Gemini 3.7 Flash的8.8%和Claude Opus 5的6.7% [10][13] - BioMysteryBench生物信息学Human Difficult测试达56.5%,超过Gemini 3.7 Flash的43.5%和Claude Opus 5的49.4% [10] - LABBench2生物学研究任务达86.2%,超过Gemini 3.7 Flash的82.1% [10] 技术实现机制 - 性能提升源于投入更多计算量完成任务,模型执行更多推理步骤并反复调用工具 [17] - 在更高推理强度设置下可能消耗更多Token,开发者可选择较低推理强度或继续使用Gemini 3.7 Flash [17] 网络安全专用模型 - CyberGym漏洞发现基准测试中,Gemini 3.8 Flash Cyber展现前沿水平的自主漏洞发现能力 [19] - 内部基准测试覆盖20种编程语言,漏洞发现成功率超过70% [25][26] - CWE-Bench补丁修复测试中Pass@1成功率达47.2%,接近领先前沿模型的47.8%但成本显著更低 [30] - Chrome安全团队发现该模型为Chrome漏洞生成的正确修复补丁数量比规模更大的商业模型提升2.6倍 [35] - Wiz内部渗透测试中漏洞发现召回率提升7.5%至9.7%,成本降低2.3至5.2倍 [35] - Google云漏洞研究团队利用该模型在不到2小时内发现关键基础漏洞,此前通常需要数月 [35] 行业影响与评价 - Aigora.ai CEO称Gemini 3.8 Flash具备Opus 5级别的代码质量,但成本只需一小部分且速度非常快 [8] - 谷歌DeepMind核心成员表示这对递归自我改进是一次巨大飞跃 [7] - 谷歌已开始使用Gemini 3.8 Flash Cyber保护公司内部代码安全 [31]