Gemini 3.8 Flash
搜索文档
Sundar Pichai Promised a Gemini Flagship in June, and Alphabet Is on Its Worst Streak Since 2015
247Wallst· 2026-09-03 23:37
核心观点 - 公司CEO Sundar Pichai承诺在2026年6月发布旗舰AI模型Gemini 3.5 Pro,但截至2026年9月2日仍未交付,取而代之的是更便宜的编码模型Gemini 3.8 Flash,导致公司股价遭遇自2015年以来最长连跌 [2][3][4] - 尽管AI模型交付不及预期,公司基本面依然强劲,Q2营收增长24.23%至1198亿美元,EPS为9.11美元,Google Cloud同比增长82%至248亿美元 [5] - 公司面临资本支出高企与现金流压力,资本支出达449亿美元,自由现金流转为负58.6亿美元,长期债务从465亿美元跃升至982亿美元,Q2 2026暂停股票回购 [6] 产品与战略 - CEO Pichai在Q2电话会议上强调“每月发布节奏”是战略,称Gemini 3.5 Pro正在测试,团队已开始为Gemini 4进行最雄心勃勃的预训练 [4] - 公司实际交付的是Gemini 3.8 Flash,Pichai称其为“主力模型”,在性能、成本、可靠性、延迟等方面达到“最佳平衡点” [4] - 公司指引投资者关注年底的Gemini 4,但6月旗舰模型的缺失已对股价造成冲击 [3] 财务表现 - Q2营收增长24.23%至1198亿美元 [5] - EPS为9.11美元,超出市场共识199.41% [5] - Google Cloud同比增长82%至248亿美元,积压订单达5140亿美元 [5] - Gemini App月活跃用户达9.5亿,API每分钟处理约220亿个token,高于上季度的160亿个 [5] - 资本支出达449亿美元 [6] - 自由现金流转为负58.6亿美元 [6] - 长期债务从465亿美元跃升至982亿美元 [6] - Q2 2026暂停股票回购 [6] - 公司当前市盈率为14倍 [6] 市场与股价 - 公司股价在过去一个月下跌10.39%,交易价格接近339.79美元 [4] - 公司今年春季曾短暂成为全球市值最高公司,但随后遭遇自2015年以来最长连跌 [4] 监管与竞争 - 法官裁定“谷歌不必出售其广告交易平台”,消除了广告货币化引擎的悬而未决风险,使公司能更积极地在价格上竞争,并跨云、搜索、YouTube和广告引擎实现AI变现 [6] - token价格“较夏季峰值下跌超过一半”,挤压了OpenAI等独立模型实验室的生存空间 [6]
谷歌又发新模型,Meta AI负责人“挑衅”:Gemini是谁啊?
第一财经· 2026-09-03 22:41
谷歌Gemini 3.8 Flash模型更新 - 谷歌于2026年9月2日推出Gemini 3.8 Flash,定位为“最智能的主力模型”,在软件工程、智能体任务及多步骤推理方面较3.7 Flash有所提升 [3] - 同步推出安全模型Gemini 3.8 Flash Cyber,在漏洞检测和自动修补方面具有前沿性能 [3] - 从3.7 Flash更新到3.8 Flash仅用时14天,模型升级周期显著缩短 [3] - 谷歌DeepMind核心成员姚顺宇表示,对模型而言只是一小步,但对RSI(递归自我改进)是一次巨大飞跃 [3] - 在DeepSWE v1.1评测中,3.8 Flash得分73.7%,仅比Claude Opus 5的74%低0.3个百分点,超过GPT-5.6 Sol的72.7%及上代3.7 Flash的65.3% [6][7] - 根据Artificial Analysis测评,Gemini 3.8 Flash智能得分59,比3.7 Flash高3分,目前排在模型榜单第十位 [7] - API价格维持每百万Token输入0.75美元、输出3.75美元,延续低价普及策略 [7] - 模型能力提升源于底层设计调整,处理复杂任务时执行更多步骤推理并以循环迭代方式调用内部工具 [7] - 每项智能指数任务成本为0.58美元,较3.7 Flash价格上涨约40%,因每任务输出token增加30%及智能体评估回合数增多 [7] - 在高难度任务中模型可能消耗额外Token,旨在提高首次成功率并减少死循环重试和人工干预 [8] - 开发者可通过调整思考配置降低消耗,或继续使用Gemini 3.7 Flash [8] - 谷歌产品逻辑为:旗舰未更新,Flash系列既守成本速度基本盘,也顶上原本旗舰的复杂任务 [8] Meta Muse Spark 1.3模型发布 - Meta于同日推出Muse Spark 1.3,对标Opus 5,在榜单中超过Gemini 3.8 Flash [9] - 升级重点放在Agent长任务、编程及推理效率,强调在较长工作流中持续调用工具、修正计划并处理多个并行任务 [9] - 在DeepSWE v1.1上成绩达75.4%,超过Gemini 3.8 Flash [9] - Meta AI负责人Alexandr Wang在社交媒体调侃谷歌,称“Gemini 是谁”,引发争议 [9][11] - 有网友认为这种明确比较“给人小家子气的感觉” [11] - Meta仅发布模型基准数据,未经开发者实际任务检测,Benchmark胜负不能等同于真实世界胜负 [11] 行业趋势与观察 - AI竞赛时间单位已从季度压缩到周 [12] - 对于开发者而言,发布宣传和榜单排名并不重要,需等待社区应用反馈才能评判模型更新是否成功 [12]
昨晚,硅谷经历了AI诸神之战
虎嗅APP· 2026-09-03 22:08
文章核心观点 AI的经济学正在发生突变,智能成本正以极快速度下降,核心计量单位正从“每百万token成本”转向“完成一个真实任务的总成本” [11][13][89] 这一趋势由三方面驱动:模型能力下放至低价区间、Agent效率提升以减少无效消耗、以及模型间通信方式的根本性变革 [87][88] 一、Google Gemini 3.8 Flash:前沿能力下放至低价区间 - Google发布Gemini 3.8 Flash,为六周内第三次更新Flash系列,定位为最强大的推理与代码模型 [16][18] - 核心提升集中在long-horizon coding和agentic workflow,在DeepSWE v1.1上取得约74%成绩,一度登顶世界第一 [21][22][25] - 与竞品能力差距缩小:Claude Opus 5约74%,GPT-5.6 Sol约73%,Fable 5约70% [27] - 关键差异在于成本:Gemini 3.8 Flash API输入0.75美元/1M token,输出3.75美元/1M token [30] - DeepSWE单任务平均成本仅2.36美元,而Claude Opus 5为11.84美元,GPT-5.6 Sol为6.46美元 [31][32] - 同一级别软件工程能力,执行成本可差数倍,这在Agent时代至关重要 [35][36] - 模型遇到复杂任务会主动work harder,因token足够便宜,可允许更长运行循环 [38][39] - 核心意义:将过去只有最昂贵frontier model才能提供的能力,压入Flash的价格区间 [40] 二、Meta Muse Spark 1.3:Agent效率提升与成本优化 - Meta发布Muse Spark 1.3,在DeepSWE v1.1上取得75.4%成绩,超越Gemini 3.8 Flash、Claude Opus 5和GPT-5.6 Sol [43][44] - 从1.2到1.3版本,成绩从约55%提升约20个百分点至75.4% [45][46] - 更关键的两个数字:工具调用减少约20%,token消耗减少约25% [48] - 模型强化了在长线程中维护多个workflow、遇到模糊任务主动询问、解决不了主动求助、不可逆操作先确认等能力 [53] - 长任务运行多轮后更不易忘记初始约束,强调模型对自身能力边界的认识 [53][54] - 这些能力在Agent时代可直接换算成钱:Agent少犯一次错误,本身就是一次推理优化 [57][58] - 行业竞争计量单位正从“一百万token多少钱”转向“把一个真实任务从头跑到尾,到底多少钱” [59] 三、Mostik:颠覆性模型间通信方式 - 初创公司Mostik登上WIRED专访,尝试让两个AI模型不再通过自然语言互相交流 [5][62] - 当前Multi-Agent系统低效:模型A生成几百上千token自然语言,模型B再全部读入重新理解 [63] - 类比为“电脑A把文件打印成几百页纸,电脑B用摄像头一页页OCR回去” [64] - Mostik试图在不同模型内部表示间建立Bridge,直接交换latent representation [66] - 实验将完整版GLM-5.2 753B与仅4B的Qwen 3.5桥接,混合系统推理成本仅为完整GLM-5.2的1/20 [68][69] - 挑战在于不同模型架构、参数、训练数据和内部坐标系不同,缺乏成熟数学语言描述共同表示 [71][72] - 1/20的数字引发对未来AI架构的思考:设备端可能只需运行0.xB或几B的小模型 [73][77][78] - 小模型负责高频廉价持续运行,云端frontier model负责低频困难推理,中间通过Bridge高效通信 [82] - 未来可能只需传输高度压缩的latent state,而非重新发送十万token的Context [80][81] - 推理成本下降幅度可能远超今天API降价30%或50%,将改变组织AI计算的方式 [83][84] 四、行业趋势与影响 - 智能正以非常夸张的速度变得便宜,降价已不止API单价下降 [89][90] - 模型价格下降、完成任务所需计算量下降、模型间信息交换方式被重新设计 [90] - 技术真正爆发发生在“终于便宜到可以随便用”的时候 [92] - 今天Agent花几十美元完成小任务不划算,未来只需几毛钱,许多应用将成立 [93][94] - 今天不可能让几十个Agent 24小时围绕一个人运行,推理成本再下降一两个数量级可能成为默认状态 [95]
RSI时代将至:谷歌、OpenAI、SSI正在发出同一个信号
华尔街见闻· 2026-09-03 13:30
核心观点 - AI行业正从“服务用户”转向“让AI参与训练、评估和优化下一代AI”,即递归自我改进(RSI)[3] - RSI正在改变AI训练形态,从“一次性训练”变为“永不停止的持续训练”,重塑算力逻辑[23][26] - 市场关于“2028年AI资本开支见顶”的叙事可能抓错变量,决定CapEx的第一变量是下一代模型是否值得继续扩大训练规模[19][21] 谷歌的RSI信号 - 谷歌发布Gemini 3.8 Flash,六周内第三款Flash模型[6] - 3.8 Flash在Artificial Analysis高推理模式下智能指数59分,接近GPT-5.6 Sol和Grok 4.6,单任务成本0.58美元,输入价格0.75美元/百万Token[7] - 谷歌DeepMind研究员姚顺宇定性:对模型是一小步,对RSI是一次巨大飞跃[8] - 谷歌内部备忘录目标为“逼出递归自我进化,把编程模型改造成全自动AI研究员,彻底打通研发闭环”[9] - 谷歌组建由DeepMind CTO领导、谢尔盖·布林直接监督的代码突击队,从OpenAI挖来后训练负责人Barret Zoph[9] - 3.8 Flash核心升级:模型被设计为执行更多推理步骤、反复调用工具,通过长时间智能体循环评估和优化自身结果,承担“规划—执行—检查—修复”完整流程[10] - 谷歌内部否决3.5 Pro候选模型,因未比Flash系列强出足够多,下一代旗舰Gemini 4仍卡在后训练阶段[10] OpenAI与SSI的动向 - OpenAI CEO Sam Altman承认延迟一次前沿强化学习训练run,为OpenAI历史上第一次主动暂停前沿训练[12] - 暂停原因:训练过程中模型能力提升速度令人震惊,Altman称“能力进步的速度只能用‘令人敬畏’来形容”[13] - Altman表示“一年前不认为超级智能会很快到来,现在认为它可能会发生”[14] - 暂停仅针对前沿RL训练run,并非所有训练停止,集群未闲置,OpenAI企业收入已超过消费者收入[14] - 英伟达宣布对SSI进行重大战略投资,SSI同时宣布未来12个月算力将扩张10倍[16] - SSI由OpenAI联合创始人Ilya Sutskever于2024年6月创立,唯一目标与产品是安全的超级智能[17] 行业共识与算力逻辑重塑 - 过去半年所有前沿实验室释放信号高度一致:OpenAI继续扩建训练集群,Anthropic持续融资建设AI基础设施,xAI不断扩建Colossus,Meta建设GW级AI园区,谷歌扩大TPU部署,SSI宣布算力扩张十倍[22] - 没有一家公司的行动体现出“训练结束了”[23] - RSI时代训练模式:模型A生成新算法→训练模型B→模型B优化训练流程→训练模型C→模型C发现更好RL策略→循环不止[25] - 算力优势直接变成研究优势,研究优势直接变成模型优势,拥有足够GPU的实验室一天能完成全部验证,缺少GPU的实验室一天只能完成5个或10个[27] - OpenAI提出Automated AI Researcher概念,Anthropic让Claude参与模型研发,谷歌AlphaEvolve利用AI寻找新算法[27] 投资与商业影响 - 知名科技投资人Gavin Baker测算:假设实验室拥有10GW算力,8GW用于推理,年化收入约4800亿美元;若将推理压缩到2GW、训练扩大到8GW,年化收入骤降至1200亿美元[28][29] - Gavin Baker认为顶尖大模型公司短期内不会追求自由现金流,会将所有利润和资金重新投入购买算力和模型训练[30] - 前沿实验室随时可能为了长期技术优势,主动牺牲巨额短期商业收入,这与Meta、谷歌等互联网公司不同[31] - 市场关于“2028年AI资本开支见顶”的叙事建立于CapEx由商业化应用需求单方面驱动的前提,但RSI提供不同判断框架:决定未来CapEx的还包括模型能力是否仍值得持续扩大训练[39][40] 前沿研究员心理变化 - Conviction创始人Sarah Guo对约250位前沿AI建设者的观察:过去12个月内,越来越多顶尖研究人员相信具备递归自我改进能力的AI研究模型出现后,人类距离指数级智能可能只有1到2年时间[33] - 部分顶尖研究员产生两种消极情绪:认为“我做的事情不重要,因为模型很快能自己做”[34]以及“唯一重要的只有算力规模,个人贡献被稀释”[35] - 这种心理变化本身是RSI逻辑被业内广泛接受的侧面印证[36] 未来趋势与核心问题 - RSI尚未被证明能稳定带来指数级能力跃迁,模型在基准测试中的提升不等于能在真实研发环境中持续自主改进,更高智能体能力会带来更高Token消耗、更复杂系统工程及更大安全风险[42] - 前沿实验室已不再将RSI视为遥远理论概念:谷歌尝试让低成本模型完成更长更复杂的智能体任务,SSI用10倍算力扩张验证研究是否值得大规模扩张,OpenAI讨论在安全、商业化和前沿训练之间重新分配资源[43] - 大模型行业下一阶段竞争可能不只是“谁的模型更会回答问题”,更为重要的是“谁能让AI更快地参与AI研发,并在安全边界内完成自我迭代”[44] - 市场不应只问AI应用收入够不够支撑数据中心建设,还需问:前沿模型能力曲线是否仍在上行、AI能否真正缩短研发周期、训练集群能否将算力转化为研究成果、安全体系能否跟上模型自我迭代速度[46]
Google starts September with AI momentum after longest monthly losing streak in over a decade
CNBC· 2026-09-03 11:28
公司近期动态与市场背景 - 谷歌结束了在华尔街超过十年的最长月度连跌后,9月初为投资者提供了几个乐观理由 [1] - 公司股价在周三上涨0.6%,但周二下跌超过1%,9月至今仍小幅下跌 [3] - 这些进展为Alphabet在经历了一个艰难的夏季后提供了更具建设性的前景,此前谷歌在AI模型竞赛中失去了一些势头,经历了DeepMind内部重大重组和高管人才流失 [3] 产品发布与技术进展 - 公司于周三发布了Gemini 3.8 Flash,这是六周内的第三个Flash模型,同时推出了针对政府和企业客户的新网络安全模型 [2] - Gemini 3.8 Flash专注于编码和代理任务,这是AI公司正试图将技术进步转化为企业收入的两个领域 [4] - 谷歌称Gemini 3.8 Flash是其迄今为止最好的推理和编码模型,在软件工程和多步骤任务上较3.7 Flash有显著改进 [4] - Google DeepMind产品管理高级总监Tulsee Doshi表示,最近的Flash模型在性能上“确实以积极的方式让我们感到惊讶”,并提供了“深入利用它们的机会” [5] - 较小的Flash模型运行成本更低,迭代速度更快,同时在部分任务上越来越接近大型前沿系统 [8] - D.A. Davidson分析师Gil Luria认为,从产品角度看,该模型让谷歌保持在竞赛中,但可能不会改变其在企业市场“遥远第三”的事实 [8] 定价策略与市场竞争 - Gemini 3.8 Flash定价为每百万输入token 75美分,每百万输出token 3.75美元,与上一代Flash模型价格相同,尽管新模型在编码、代理任务和推理方面有所改进 [9] - Gemini Enterprise新增按需付费定价、高达20%的token折扣、代理支出月度上限以及零美元基础订阅选项 [10] - 谷歌直接针对微软和Anthropic,声称其经常性席位费用和单独产品许可使其产品更昂贵且灵活性更低 [10] - 近四分之三的Google Cloud客户已在使用其AI产品,这些客户的支出比原始承诺高出约50% [11] - DeepMind的Demis Hassabis描述了一个未来,Gemini可作为通用层协调更便宜的专业模型和代理,在该场景中广度可能与拥有最佳模型同等重要 [12] 网络安全与政府合作 - 谷歌表示Gemini 3.8 Flash Cyber能够以前沿级性能检测和修补软件漏洞,同时运行速度更快、成本更低 [13] - Doshi表示公司很高兴能够以“一小部分成本、更快速度”为防御者提供前沿级性能的解决方案 [14] - 由于这些能力可能被滥用,谷歌通过新的Fairwind Program初步限制访问权限,仅面向一小部分受信任的政府和企业防御者 [14] 外部支持与法律胜利 - 伯克希尔哈撒韦CEO Greg Abel公开表达了对Alphabet AI地位的信心,称其从旗下公司使用AI的方式和收益中看到了谷歌作为重要参与者的价值 [2][17] - 一名联邦法官驳回了司法部要求谷歌出售其广告交易所AdX的请求,选择了行为补救措施而非监管机构寻求的结构性拆分 [2][19] - 该裁决是继去年另一项反垄断裁决后,法院再次拒绝强制谷歌剥离Chrome [19] - 反垄断律师Wyatt Fore表示,两起案件法院都选择不拆分公司是“大事”,谷歌正“没有双手被绑在背后”地进入AI竞赛 [20] 财务与投资背景 - 尽管部分市场专家认为谷歌在AI领域的地位不稳,但其广告业务持续增长,最新季度增长了14% [18] - Alphabet在AI基础设施上投入巨额资金,公司依赖增长和市场份额提升来在长期内带来回报 [15]
信达国际控股港股晨报-20260903
信达国际控股· 2026-09-03 09:42
市场回顾与短期展望 - 恒指9月2日低开,最多跌320点,低见25,008点,试穿8月低位25,089点,收跌18点或0.1%,报25,311点,大市成交2,167亿元,北水净流入41亿元 [5] - 美股三大指数上升,道指升0.6%,标指及纳指升0.5%,现货金价升1.2% [5] - 恒指短期调整压力仍较大,受累于海外债息高企,料将考验7月中下旬横行区底部约24,800点 [5] - 近期A股成交缩量,昨日成交金额仅1.82万亿元人民币,过去十个交易日平均值约2.0万亿人民币,明显低于今年首7个月超过2.7万亿人民币的日均成交,缩量下市场较难有明确行情 [5] - 第二季对A股整体盈利增长贡献最大的是电子行业,但海外股市对AI算力企业的追捧已明显降温,影响A股同类企业走势,暂无其他投资主题接力 [5] - 海外多国长债收益率创多年新高,美国8月ADP就业人数低于预期,令联储局9月加息预期略降至60-65%,油价高位徘徊,农产品价格自7月以来呈涨势,全球通胀压力难解 [5] - 美欧日长债收益率反复上行,限制金融市场表现,德、英、日等地10年国债收益率创多年新高 [5] 短期看好板块 - 内银股:第二季净息差有所改善 [5] 宏观焦点 - 人行行长潘功胜表示,中国无意通过汇率贬值获取贸易竞争优势,从不刻意追求贸易顺差,将实施有管理的浮动汇率制度,防范市场“羊群效应”和非理性预期 [6] - 内地下半年将整治行业“内卷式”竞争乱象,深化“幽灵外卖”专项整治,严打食品、电动自行车、计量等民生领域违法行为 [6] - 中国交易所制定L2行情数据使用规范,严防滥用、“绕道抢跑”,对数据自用和转发做出明确规定 [6] - 国家能源局要求加快输电通道等重大电网工程核准建设,“十五五”期间中国电力需求仍将保持年均5%左右的增长 [6] - 罗兵咸永道报告称,全球数据中心累计支出到2050年将达31.6万亿美元,美国将吸纳近一半投资,规模达15.1万亿美元,亚太地区料吸纳8.2万亿美元 [6] - 今年全球数据中心支出估计约8000亿美元,2030年增至1.1万亿美元,2050年达1.8万亿美元,若AI普及速度超出预期,未来25年支出可能达50万亿美元 [6] - 标普表示,中国最新房地产政策措施旨在提高透明度,加强监管预售资金,推动现房销售,逐渐淡化预售模式 [6] - 香港8月住宅买卖合约总值362亿元,按月下跌13.6%,按年减少14.2% [6] - 富时中国50指数新纳入华虹宏力(1347)及澜起科技(6809),剔出快手科技(1024)及顺丰控股(6936) [6] - 希音(0625)将于9月14日收市后被纳入恒生综合指数及其分类指数,9月15日起生效 [6] - 特朗普政府考虑对进口半导体实施新一轮关税,对在美国建厂的企业给予关税减免 [7] - 美国8月ADP私人企业职位增加3.8万个,低于市场预期的4.7万个 [7] - 美国7月工厂订单按月增长0.9%,高于市场预期的0.6% [7] - 伊朗在霍尔木兹海峡袭击一艘沙特油轮,造成两名菲律宾船员死亡 [7] - 英国银行将高风险资产作为抵押品提交给英伦银行,8月18日抵押了价值19亿英镑的最高风险等级抵押品,是前一周的3倍 [7] - 日本央行鹰派委员高田创表示,央行应灵活实施加息,今年是重要转折点 [7] - 日本央行行长植田和男暗示央行或于9月加息,称官员们会把价格上行风险考虑在内 [8] - 加拿大央行维持利率在2.25厘不变,称通胀上行风险增加 [8] - 澳洲第二季度GDP按年增幅从2.5%放缓至2.1%,高于市场预期的1.8% [8] 企业消息 - 月之暗面(Kimi)以保密形式向港交所递交A1文件,启动港股IPO流程,同时以500亿美元投前估值推进新一轮融资 [9] - 云英谷科技(3310)与广发证券签署A股上市辅导协议,拟启动在境内发行A股的工作 [9] - 博通第三财季经调整后净收入录得295.9亿美元,按年急增86%,略胜市场预期,AI晶片收入劲增两倍达167亿美元 [9] - 博通预计第四财季经营收入约348亿美元,按年增长93%,但低于市场预期的约350.5亿美元 [9] - OpenAI限制Astra模型,增安全措施防失控自主发起攻击,该模型能攻破网页浏览器沙盒,网络安全风险评为“危急”级别 [9] - Google发布Gemini 3.8 Flash推理模型,在DeepSWE v1.1基准测试中得分73.7%,略低于Claude Opus 5的74% [9] - Hugging Face旗下Pollen Robotics开售“鸭子机器人”(Microduck),售价399美元,预售一周售出逾1万只,销售额突破500万美元,搭载瑞芯微(603893.SH)的RK3566芯片 [9] - 阿里巴巴(9988)小幅升级旗舰AI模型至Qwen3.8-Max-0902,在网页开发方面排名高于Claude Opus 5及Kimi K3 Max [9] - 腾讯控股(0700)WorkBuddy开放平台正式上线,首批引进超百家生态伙伴,面向智能硬件、行业应用与开发者开放底层Agent能力 [9] - 小米集团(1810)将于9月7日举行新产品发布会,发布全新折叠屏旗舰手机小米18 Fold,起售价约在12000至12999元人民币 [10] - 小米18 Fold将首发搭载玄戒O3 AI旗舰处理器,同日发布小米平板9 Pro Max [10] - 华为将于9月7日下午2时30分举行发布会,展示新一代三折机HUAWEI Mate XT 2 [10] - 苹果将于9月9日发布iPhone 18 Pro、iPhone 18 Pro Max及首部折叠手机iPhone Ultra [10] - OPPO内地门店9月将上调多款机型售价,涨幅300至500元人民币,涉及Reno16系列和一加Turbo 6X Pro系列 [10] - 理想汽车(2015)新一代理想Mega Home上市,售价50.98万元人民币,右軚版本将于今年第四季登陆香港、澳门、新加坡等市场 [10] - 新一代理想Mega Home搭载108kWh宁德时代三元锂5C超充电池,CLTC综合续航710公里,10分钟可充电500公里 [10] - 石四药(2005)盐酸地尔硫䓬片(30mg)取得中国药监局批准通过仿制药质量和疗效一致性评价 [10] - 翰森制药(3692)创新药注射用HS-20093上市许可申请获中国药监局受理,用于治疗小细胞肺癌成人患者 [10] - 康方生物(9926)核心自研药物依达方在研究中达到关键次要终点,共入组398例受试者 [10]
谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
量子位· 2026-09-03 08:32
核心观点 - 谷歌发布Gemini 3.8 Flash,Coding能力大幅提升,在LMArena Agent榜单空降第14名,以微弱优势险胜DeepSeek-V4-Pro[2] - 该模型定价与3.7 Flash保持一致,未涨价[4][5] - 谷歌采用“多步骤循环”策略弥补模型智能不足,与OpenAI和Anthropic追求更少步骤完成任务的路径不同[9][10][11] - 3.8 Flash是市面上输出最快的模型,速度比第二名Meta高近一倍[14] - 谷歌六周内连出三款Flash模型,人事变动频繁,包括二进制能力拥有者Jeff Dean离职[21] - 同时Meta发布Muse Spark 1.3,对标Opus 5,Agent和Coding能力大幅提升[50] 性能与基准测试 - DeepSWE v1.1长周期软件工程任务得分73.7%,高于3.7 Flash的65.3%,接近Claude Opus 5的74.0%[27] - Terminal-bench 2.1 Agentic终端编码得分89.4%,高于3.7 Flash的85.8%[20] - Terminal-bench 4.0通用Agent能力得分19.1%,高于3.7 Flash的11.2%,但远低于Claude Opus 5的51.8%和GPT-5.6 Sol的37.3%[20] - HLE-Verified多学科专家推理得分54.9%,高于3.7 Flash的53.6%[27] - CharXiv复杂图表推理得分86.2%,高于3.7 Flash的84.5%[27] - LVBench长视频理解得分87.8%(Agentic模式)和87.1%(静态模式),高于3.7 Flash的85.4%[27] - OSWorld-2.0 Agentic计算机使用得分59.0%,高于3.7 Flash的50.6%[27] - BioMysteryBench生物信息学研究工作流Human Solvable得分88.8%,Human Difficult得分56.5%,均高于3.7 Flash的87.1%和43.5%[27] - LABBench2生物学真实研究任务得分86.2%,高于3.7 Flash的82.1%[27] - GDP.PDF Expert PDF文档理解得分35.0%,略高于3.7 Flash的34.0%[27] 企业级Agent场景 - 金融领域Vals Finance Agent v2得分61.4%,高于3.7 Flash的59.0%,并超过Claude Opus 5的58.6%和GPT-5.6 Sol的53.8%[27] - 法律领域Harvey's Legal Agent Benchmark复杂法律工作流全部通过率10.0%,高于3.7 Flash的8.8%,并超过Claude Opus 5的6.7%和GPT-5.6 Sol的2.5%[27] - GDPVal-AA v2知识工作Elo评分1545,高于3.7 Flash的1482[27] 定价与成本 - 输入价格$0.75/百万Token(常规$1.50),输出价格$3.75/百万Token(常规$7.50),与3.7 Flash一致[27] - 相比Claude Opus 5输入$5.00/百万Token、输出$25.00/百万Token,成本优势显著[27] - 相比GPT-5.6 Sol输入$4.00/百万Token、输出$20.00/百万Token,成本更低[27] 网络安全模型3.8 Flash Cyber - 谷歌史上最强网络安全模型,专攻自主发现漏洞和自动生成补丁[38] - CyberGym漏洞发现测试超过3.5 Flash Cyber和其他前沿模型[38] - 覆盖20种编程语言的内部代码库测试,挖洞成功率超过70%[38] - CWE-Bench修洞pass@1达到47.2%,接近前沿模型的47.8%,成本低出一大截[42] - Chrome安全团队使用后,产出的正确补丁数量是最强商业模型的2.6倍[45] - Wiz内部渗透测试召回率提升7.5到9.7个百分点,花费仅为其他前沿模型的2.3到5.2分之一[46] - Google Cloud漏洞研究团队不到两小时挖出以往需研究数月的关键基础漏洞[47] - 该模型不公开发布,仅通过Fairwind计划向受信防御者开放[48][49] 潜在风险与争议 - 有网友指出模型在Terminal-bench 4.0等新基准上表现不佳,怀疑是刷分结果[19] - 智能方面未见本质提升,高分可能依赖多步骤推理和反复迭代调用工具,消耗更多Token[31][32][33] - 实际使用效果存疑,若智能水平不足,可能输出大量劣质Token[15][16]
富爸爸穷爸爸作者称负债12亿美元;戚薇回应“卖脸”争议;智谱上半年营收9.54亿,同比大增399.7%丨邦早报
创业邦· 2026-09-03 08:20
苹果公司高管变动与薪酬 - 苹果公司披露蒂姆·库克于周二正式履职执行董事长新岗位,其薪酬包包含薪资与股权合计4700万美元[2] - 苹果公司表示,库克继任者约翰·特努斯的基本工资上调至300万美元,若达成业绩考核目标,在2027财年可获得目标年度股权奖励5500万美元[3] 演员戚薇AI数字分身商业化 - 演员戚薇公布AI漫剧《末日盛夏》,女主角“韩清夏”由其合法授权的数字分身制作,此举被网友归纳为“卖脸”[3] - 戚薇回应争议称,用AI做内容创作太新,规则未建立完善,目前未考虑该剧是否赚钱,希望此举给市场更多信心[5] 罗伯特·清崎债务争议 - 《富爸爸穷爸爸》作者罗伯特·清崎宣称自己“负债12亿美元”,其前妻兼长期商业伙伴金·清崎表示,该数字是清崎与合作伙伴共同持有的房地产项目所背负的债务总额[5] 燧原科技科创板IPO - 燧原科技公告,首次公开发行股票并在科创板上市,发行股份数量为4303.5173万股,发行价142.18元/股[5] - 网上发行有效申购户数703.2045万户,有效申购股数420.66亿股,因网上发行初步有效申购倍数超100倍,启动回拨机制,将344.3万股从网下回拨至网上[5] - 回拨后,网上最终发行1032.85万股,最终中签率0.02455315%[5] 智谱大模型商业化与财务表现 - 国产大模型厂商智谱入驻天猫开设官方旗舰店,企业和个人可直接通过电商平台购买智谱大模型套餐[5] - 智谱旗舰店在售商品包括智谱GLM Coding Plan个人版Lite、Pro、Max等订阅套餐,价格最低的个人版Lite月付价格为118元,团队版月付“标准席位”价格为598元[5] - 上市七个多月的智谱交出上半年成绩单,上半年收入9.54亿元人民币,同比增长399.7%,规模已超过2025年全年[14] - 截至8月末,智谱ARR按月度年化口径达到16亿美元,按周度年化口径计算则已超过20亿美元,相当于MiniMax同期的2.5倍[14] 章泽天播客与职业梦想 - 章泽天播客更新,与何超琼进行107分钟对谈,何超琼分享“严母慈父”家教,并透露其创立的公关公司一年赚了600多万[7] - 章泽天表示中学时梦想是做记者,大学时曾在电视台实习,如今做播客算是圆梦,并表示会继续做下去[7] 星宇股份用工事件回应 - 星宇股份董事长兼总经理周晓萍回应近期用工事件,表示公司依据法律法规制定各项用工制度和流程,并在事件发生后重新审视及整改[9] - 周晓萍再次向社会和广大投资者真诚道歉,公司将严守合规运营底线,构建和谐劳动关系,努力以更好业绩回馈投资者[9] Kimi API与阿里模型更新 - 月之暗面宣布,Kimi API现已同时支持OpenAI Responses API格式与Anthropic Messages API格式,开发者无需转换格式或本地代理,即可通过Codex或Claude Code直连Kimi K3等模型[9] - 阿里更新旗舰模型Qwen3.8-Max,在聚焦前端编程能力的全球权威三方榜单CodeArena中,提升22分至1691分,领先Claude Opus5、Kimi K3等模型,位居总榜第一[9] - CodeArena更新的模型性价比榜单显示,Qwen3.8-Max新版本每百万Tokens综合平均仅5美元[9] 宇树科技股价表现 - 9月2日开盘后,宇树科技股价走低,盘中跌幅超3%,首次跌破550元/股[12] - 相较于首日开盘高点1100元/股,宇树科技股价已经腰斩,市值蒸发超2000亿元[12] 谷歌与特斯拉AI进展 - 谷歌发布Gemini 3.8 Flash及安全版Cyber,六周内Flash系列第三次迭代,新模型强化Agentic loops,主打自主编程与推理,价格维持低价(输入0.75美元/百万Token)[14] - 实测显示Gemini 3.8 Flash速度极快,但复杂任务如Three.js场景生成,细节表现不及Claude Opus 5和Kimi K3[14] - 特斯拉表示,在欧洲其FSD监督版软件发生碰撞事故的概率,比人工驾驶的特斯拉车辆低4.1倍,该结论基于48月间五个欧洲国家合计约1.02亿公里的行驶数据[14] - 欧盟可能最早于10月6日举行投票,以批准FSD监督版的更广泛应用,目前超过7万名用户在荷兰、比利时、丹麦、爱沙尼亚和立陶宛使用FSD监督版,系统每天记录行驶里程超过100万公里[14] 马斯克谈SpaceX创业历程 - 埃隆·马斯克提到,如果“猎鹰1号”第四次发射也失败,SpaceX就不会存在了,这番话回应了彼得·戴曼迪斯关于连续三次发射失败后SpaceX只剩最后一次机会的推文[14] OpenAI CEO观点 - OpenAI CEO萨姆·奥特曼表示不喜欢智能眼镜,认为跟戴着摄像机和灯光装置的人交谈非常不舒服[16] - 奥特曼反驳AI数据中心耗水担忧,称现代数据中心用水量与办公楼用水量大致相当,并引用2024年弗吉尼亚州政府报告,指出大多数数据中心用水量与普通大型办公楼相同或更少[16] AI初创公司融资动态 - AI初创公司Cognition据悉拟融资约10亿美元,估值达470亿美元[17] - AI新材料研发公司鼎犀智创完成数亿元Pre-A轮融资,由鼎晖百孚领投,资金将用于RhinoMat材料科学基础大模型及底层技术研发等[17] - 空间智能企业映界科技MirrorSpace完成超千万元种子+轮融资,由海愿资本领投,资金将用于感知硬件的商业化交付等[17] - 青年创业团队Heygo完成第一轮数百万美金天使融资,由厚雪机构独家投资,Heygo曾推出一款针对单板滑雪的AI硬件[17] - 制造物理AI公司合木智能完成种子轮千万级融资,投资方为创新工场,计划围绕AI大脑进一步开发硬件产品[17] - 天工机器人完成数亿元融资,由初芯基金领投,资金将用于分拣类机器人扩大量产规模等[18] 豆包工作新功能 - 豆包工作发布两项新功能:一是多Agents并行,负责组织的主Agent会先行拆解,将垂直、专业的任务交由不同子Agent分别处理[18] - 二是Mac系统的操作电脑功能,可让豆包实现本地GUI操作,在没有MCP、API、插件和CLI的情况下也能看懂界面并完成相应操作[18] 腾讯WorkBuddy开放平台 - 腾讯公司公关总监张军表示,WorkBuddy宣布开放平台正式上线,首批引入超百家生态伙伴,面向智能硬件、行业应用与开发者等开放底层Agent能力[21] - 9款联名智能硬件在发布会上亮相,合作方包括Plaud、Rokid、影石、科大讯飞、安克、猛玛、京东京造等,30余个行业应用同步接入,覆盖金融、法律、医疗、教育、公益等20多个领域[21] 理想汽车与比亚迪新车发布 - 理想汽车旗下旗舰纯电MPV新一代理想MEGA上市,推出Home版一款车型,售价为50.98万元,相比老款起售价便宜了2万元[21] - 理想汽车董事长李想回应MEGA外观设计争议,表示“模仿的风险永远比原创低得多”,不会因为外界声音改变对产品的坚持[21] - 比亚迪海洋网科技旗舰SUV海狮08正式上市,官方指导价为22.99万-27.99万元,全系标配天神之眼B-辅助驾驶激光版、云辇-A闭式双腔空悬、后轮转向[22] OpenAI与Meta模型发布 - OpenAI计划很快推出名为Astra的AI模型,前期执行高级网络安全相关任务的能力将仅限于部分测试人员,之后通过“Daybreak Blue”计划向更多用户开放[22] - OpenAI表示该模型已达到“关键网络安全门槛”,已加强Astra模型的安全防护措施以防止被滥用[22] - Meta公司推出Muse Voice Transcribe,是其首个实时音频感知模型,定价为每1000分钟音频3美元[22] - Muse Voice Transcribe可在包含20余名说话者的录音中分离不同发言者,模型训练覆盖70余种语言,其中25种在发布时完成验证,支持长度超过1小时的音频[22] 谷歌AI图片设计工具上线 - 谷歌宣布正式上线AI图像设计与编辑工具Google Pics,用户可通过pics.new使用网页版,也可在Google Docs和Google Slides中直接调用编辑器[22] - Google Pics基于谷歌“Nano Banana”图像生成模型驱动,提供“精准的物体级图像编辑”能力,核心功能包括选择并单独编辑特定物体、编辑图像中文字、裁剪图像、提升至2K或4K分辨率等[22][23] 小米折叠屏手机发布预告 - 小米官宣Xiaomi 18 Fold将于9月7日发布[25] 汽车后市场与半导体行业展望 - 《关于推动商品消费扩容升级的实施意见》提出,培育壮大汽车后市场,支持发展汽车改装、维修保养、赛事运动、房车露营,建立传统经典车认定和管理制度[27] - SEMI产业研究资深总监曾瑞瑜上修半导体成长预估,今年市场规模将突破1.5兆美元,预估2030年绝对可以突破2兆美元,强劲需求正由芯片一路向前段设备、测试、先进封装与材料市场扩散[27]
8点1氪:星宇董事长就解约应届生致歉;中一签或赚28万,燧原科技中签率公布;苹果新任CEO薪酬公布,略高于前任库克
36氪· 2026-09-03 08:04
星宇股份用工事件回应 - 星宇股份董事长周晓萍就近期“解约应届生”舆情公开回应,公司已发布致歉信并正在政府部门指导下妥善落实相关措施 [2] - 周晓萍对披露真实情况的媒体监督表示衷心感谢,公司深刻反省并真诚道歉 [2] - 公司对部分媒体的不实报道已通过网信和网安部门进行投诉和举报,以维护公司合法权益 [2] 燧原科技IPO与国产GPU - 燧原科技披露科创板上市网上发行申购情况及中签率,本次发行股份数量为4303.5173万股,发行价142.18元/股 [4] - 网上发行有效申购户数703.2045万户,有效申购股数420.66亿股,因申购倍数超100倍启动回拨机制,最终中签率0.02455315% [4] - 燧原科技与摩尔线、沐曦股份、壁仞科技并称“国产GPU四小龙”,摩尔线程、沐曦股份上市首日收盘涨幅分别超425%和692% [4] - 若燧原科技上市首日涨幅超400%,中一签浮盈将超28万元 [4] 苹果公司人事与薪酬 - 苹果公司计划向新任CEO约翰·特努斯支付300万美元年薪,外加2027财年目标年度股票奖励5500万美元 [4] - 2025财年,前任CEO库克基本年薪300万美元及5000万美元股票奖励,最终实际薪酬约7430万美元,含1200万美元非股权激励和176万美元其他薪酬 [4] - 苹果官方X账号已取关蒂姆·库克,仅关注新任CEO约翰·特努斯 [4] OpenAI下一代模型发布 - OpenAI计划尽快发布下一代AI模型Astra,该模型是首个达到“关键”网络安全能力门槛的AI模型,将限制使用范围 [5] - Astra能发现此前未知的安全漏洞,并在无需人类逐步指导的情况下利用漏洞并发起攻击 [5] - Astra在ExploitBench测试中取得满分,该测试评估大语言模型利用已知系统漏洞实施攻击的能力 [5] 谷歌发布Gemini 3.8 Flash系列 - 谷歌正式推出Gemini 3.8 Flash及面向网络安全场景的Gemini 3.8 Flash Cyber,为六周内第三款Flash版本模型 [5] - 模型输入成本0.75美元/百万Tokens,输出3.75美元/百万Tokens,单任务成本0.58美元,生成速度达305 tokens/s [6] - 基准测试智力指数59分,软件工程测试DeepSWE v1.1取得73.7%成绩,综合表现逼近GPT-5.6 Sol、Opus 5等旗舰模型 [6] - 安全专项版本Gemini 3.8 Flash Cyber漏洞挖掘能力大幅领先,实测两小时即可发现高危漏洞,不对公众完全开源,仅对可信机构开放 [6] 英伟达拟收购Hugging Face - 英伟达正深入谈判拟以近140亿美元收购AI开源平台Hugging Face,若达成将为2025年全球AI领域最高金额收购案 [6] - 交易包含129亿美元现金对价与10亿美元核心员工留任激励,条款仍有调整空间,或于本周敲定 [6] - Hugging Face被誉为“AI界GitHub”,坐拥超1300万全球开发者、300万个开源AI模型,年化营收约1.5亿美元 [7] - 英伟达2023年已参投其D轮融资,本次收购报价较彼时估值涨幅近三倍 [7] 腾讯WorkBuddy开放平台上线 - 腾讯WorkBuddy宣布开放平台正式上线,首批引入超百家生态伙伴,面向智能硬件、行业应用与开发者开放底层Agent能力 [7] - 发布会现场9款联名智能硬件首发亮相,合作方包括Plaud、Rokid、影石、科大讯飞、安克、猛玛、京东京造等品牌 [7] - 30余个行业应用同步接入,覆盖金融、法律、医疗、教育、公益等20多个领域 [7] Kimi API支持新格式 - 月之暗面宣布Kimi API现已支持OpenAI的Responses API格式和Anthropic的Messages API格式 [8] - 使用Codex或Claude Code的用户可通过自定义模型提供商直连kimi-k3、kimi-k2.7-code-highspeed、kimi-k2.7-code、kimi-k2.6等模型 [8] 马斯克预告Grok 4.7模型 - 马斯克在X平台预告10天后发布Grok 4.7模型,参数规模达2.1万亿,较Grok 4.6的1.5万亿增长40% [8] 智谱入驻天猫开启Token零售 - 智谱开设天猫官方旗舰店,上线GLM Coding Plan系列订阅套餐,面向个人及中小团队零售AI编程服务,支持月、季、年订阅 [8] - 套餐价格大幅上调,Pro版月费从149元涨至538元,涨幅达3.6倍,新版升级为GLM-5.3模型,采用积分制计费 [8] - 此次入驻标志国内大模型厂商正式开启Token大众化零售模式,智谱正加速商业化转型,API业务已成为核心营收支柱 [8] 追觅回应放弃整车量产 - 追觅科技确认终止“星空计划”整车量产项目,汽车业务整体并入产业研究院,仅保留电机、底盘控制等底层技术储备 [9] - 公司主动战略纠偏,将200余个业务单元整合为智能家庭、户外庭院、智能出行、具身智能四大主业 [9] - 同步收缩关停MOVA品牌重叠业务、手机等多项跨界孵化项目,集中资源夯实核心主业 [9] - 追觅表示将妥善承接供应商合同与账款事宜,建立专项处理机制 [9] 猛玛与WorkBuddy达成生态合作 - 腾讯WorkBuddy宣布与专业音视频硬件品牌HOLLYLAND猛玛达成深度生态合作,推出猛玛LARK A2无线麦克风WorkBuddy联名款 [9] - 该产品为首款原生联动WorkBuddy智能体的AI语音入口,用户通过麦克风机身按键即可唤醒语音输入、删除内容并发送指令 [9] 本田中国回应供应商降价要求 - 有消息称本田已向供应商下达指令,要求将部分关键零部件成本削减30%,包括软件定义汽车相关零部件 [10] - 本田中国回应称“这不是Honda官方发布的内容”,公司一直致力于与供应商共同创新合作,持续开展成本优化活动 [10] 字节跳动上调期权价格 - 字节跳动调整期权价格,在职员工从229.5美元/股调整至241.35美元/股,涨幅约5.1% [10] - 这是2026年以来字节第二次调整期权价格,上一次在今年4月从200.41美元/股调整为229.5美元/股 [10] Minimax成为内地投资者新宠 - Minimax Group Inc成为上月内地投资者最青睐的港股,8月内地投资者通过港股通买入价值106亿港元的Minimax股票 [11] - 买入规模超过阿里巴巴和腾讯控股,自8月6日被纳入港股通以来,南向投资者已累计持有该AI初创企业9.7%的股份 [11] 微信灰度测试新功能 - 新版微信新增2个功能:长按左下角“微信”可查看当前全部未读聊天(正在灰度中) [11] - 聊天中有未领取的红包及转账时,聊天框右上角会出现“红包”“转账”提醒 [11] 全球数据中心资本支出预测 - 普华永道预计2026年至2050年间全球数据中心资本支出或将达到31.6万亿美元 [11] - 如果人工智能普及速度加快,潜在增幅可达50万亿美元 [11] - 人工智能基础设施建设周期每四到六年重置一次,预期支出将超过美国和英国铁路扩建及互联网建设成本总和 [11] 欧盟首次AI执法行动 - 欧盟委员会依据《人工智能法案》向30余家AI企业发送信息调查请求,为法案执法权力生效以来首次正式执法行动 [12] - 信息请求涉及AI系统安全性和版权合规两大核心问题,属于正式调查前的初步步骤 [12] - 收到请求的企业如提交不正确、不完整或具误导性回复,可能面临最高1500万欧元或全球年营业额3%的罚款 [12] SK海力士资金汇回与韩国干预 - SK海力士7月发行265亿美元美国存托凭证后,韩国外汇当局购买了约200亿美元SK海力士汇回的资金 [12] - 韩国外汇稳定基金通过场外交易购汇 [12] 特朗普家族投资Polymarket - 美国总统特朗普之子小唐纳德·特朗普旗下风险投资公司1789 Capital领投预测市场Polymarket新一轮融资 [12] - 预计投资约3亿美元,即将成为其最大投资方之一,该轮估值达210亿美元 [12] G20财长会议未发表公报 - 8月31日至9月1日举办的G20财长和央行行长会议因各方分歧未能发布会议公报 [13] - 中方表示自美国接任2026年G20主席国以来始终积极、建设性参与议题讨论,对未能发表公报深表遗憾 [13] - 中方强调G20应恪守协商一致、平等参与原则,期待美方及各成员推动2026年G20迈阿密峰会取得积极成果 [13] AI调用价格大幅跳水 - AI调用单价指数创历史新低,较今年夏季高点近乎腰斩,用户和企业使用大模型成本大幅下降 [14] - 本轮降价源于行业激烈内卷,国内Kimi等高性价比AI模型低价优势倒逼OpenAI等海外巨头跟进降价 [14] - 价格下跌利好普通用户但大幅压缩AI企业利润,行业出现明显“增收不增利”困境 [14] - 业内指出AI行业单纯比拼模型性能的时代结束,未来将转向差异化赛道竞争 [14] 雀巢出售保健品业务 - 雀巢集团以10亿美元代价出售旗下主流维生素、矿物质和补充剂业务,涉及7个品牌 [14] - 交易涉及Nature's Bounty、Osteo Bi-Flex、Ester-C、Gard、Nuun、Puritan's Pride和Sisu等品牌及相关美国自有品牌补充剂业务 [14] - 业务主要位于美国,同时在加拿大和中国等多国布局,交易预计2027年上半年完成 [14] - 接手方为总部位于美国波士顿的私募股权公司Yellow Wood Partners [14] 《富爸爸穷爸爸》作者负债争议 - 畅销书作者罗伯特·清崎宣称自己“负债12亿美元”,其前妻金·清崎表示该数字为与合作伙伴共同持有的房地产项目债务总额 [15] - 清崎与合作伙伴持有约1500套公寓,清崎本人承担的份额要小得多 [15] “易中天”概念股下挫 - 9月2日早盘“易中天”集体下挫,新易盛、中际旭创、天孚通信盘中均跌超5%,中际旭创总市值跌破1万亿元 [15] - 截至下午收盘跌幅收窄,新易盛跌4.00%,天孚通信收跌0.70%,中际旭创跌4.29%,最新市值9709亿元 [15] 伯克希尔投资Alphabet - 伯克希尔哈撒韦CEO阿贝尔证实巴菲特主导了伯克希尔对Alphabet的投资,动因在于该公司的人工智能优势 [15] - 阿贝尔认为人工智能数据中心对伯克希尔哈撒韦能源公司而言是一项重大机遇 [15] 美股三大指数收涨 - 9月2日美股三大指数集体上涨,纳指涨0.45%,标普500涨0.46%,道指涨0.56% [16] - 大型科技股多数上涨,英伟达涨超3%,Meta涨超2%,谷歌、特斯拉、亚马逊小幅上涨,微软、苹果小幅下跌 [16] - 热门中概股普跌,蔚来跌近5%,哔哩哔哩跌超2%,拼多多跌超1%,小鹏集团、百度、网易、京东小幅下跌,理想汽车涨0.92% [16] 黑石投资网络安全初创企业 - 黑石集团对初创网络安全公司Huskeys进行早期押注,该公司打造AI网关防护系统应对自动化网络流量风险 [17] - 黑石创新投资领投2700万美元A轮融资,这家成立仅一年的公司投后估值超1亿美元 [17] - 交易完成后黑石成为该公司第二大外部投资方,仅次于以色列风投机构10D [17] 天目先导启动IPO辅导 - 溧阳天目先导电池材料科技股份有限公司于2026年9月1日办理辅导备案登记,拟首次公开发行股票并上市,辅导券商为中信证券 [19] - 公司无控股股东,罗飞直接持股2.34%,通过持股平台合计控制19.08%股份,直接、间接控制21.42%股份,为公司实际控制人 [19] “鼎犀智创”完成Pre-A轮融资 - AI新材料研发公司“鼎犀智创”完成数亿元Pre-A轮融资,由鼎晖百孚领投,九合创投、彬复资本、龙芯创投、顺禧基金、中关村资本跟投 [20] - 资金将重点用于RhinoMat材料科学基础大模型及底层技术研发、多场景可编排AI智能体与自主进化实验室体系建设、碳基高性能材料放大验证 [20] “天工机器人”完成融资 - 北京天下先智创机器人技术有限责任公司(天工机器人)完成数亿元融资,由初芯基金领投,经纬创投、合肥国资等跟投 [21] - 资金将重点用于分拣类机器人扩大量产规模、基于人形的分拣机器人研发与商用化迭代及海外市场业务拓展 [21] AI初创公司Cognition拟融资 - 人工智能初创公司Cognition据悉拟融资约10亿美元,估值达470亿美元 [22] “Heygo”完成天使融资 - 由前字节、大疆、腾讯青年创业团队成立的“Heygo”完成第一轮数百万美金天使融资,由厚雪机构独家投资 [22] - Heygo在2025年正式成立,曾推出一款针对单板滑雪的AI硬件 [22] 京沪高铁半年报业绩 - 京沪高铁披露2026年半年报,上半年实现营业收入218.42亿元,同比增长3.94% [23] - 归母净利润和扣非净利润均为67.71亿元,均同比增长7.21%,高于同期国泰航空62.43亿港元的最高盈利水平 [23] - 第二季度录得净利润36.28亿元,环比一季度增长14.7% [23] - 业绩增长得益于客流攀升、票价上浮及财务费用优化,京沪高铁是国铁集团核心盈利支柱 [23] 戴森推出AI智能牙刷 - 戴森推出首款内置摄像头的智能电动牙刷CameraJet,售价499美元,国行价3899元 [24] - 刷头内置高清微型摄像头,拍摄图像由AI分析后能识别牙菌斑分布和牙龈状态,提供实时清洁指导 [24] - 通过与配套手机应用连接,可生成用户口腔健康地图,标注需要重点清洁的区域 [24]
刚刚,谷歌Gemini 3.8登场!姚顺宇:RSI巨大飞跃
机器之心· 2026-09-03 06:34
核心观点 - 谷歌在六周内推出第三款Flash系列模型Gemini 3.8,包含通用版和网络安全专用版,在保持成本优势的同时显著提升推理、代码和Agent能力 [1][4][6] 模型版本与定位 - Gemini 3.8 Flash定位为高智能通用工作模型,重点强化软件工程、Agent任务及复杂多步推理 [4] - Gemini 3.8 Flash Cyber是谷歌目前能力最强的网络安全模型之一,专注漏洞发现和自动化补丁修复 [6] - 两个版本基于同一底层模型能力,通过长期运行的Agent循环机制增强表现 [7] 定价与成本优势 - Gemini 3.8 Flash输入Token每百万0.75美元,输出Token每百万3.75美元,与Gemini 3.7 Flash相同 [5] - 对比Claude Opus 5输入每百万5美元、输出每百万25美元,成本仅为后者的15% [10] - 对比GPT-5.6 Sol输入每百万4美元、输出每百万20美元,成本优势明显 [10] 性能提升与基准测试 - DeepSWE v1.1长周期软件工程测试中Gemini 3.8 Flash达73.7%,超过Gemini 3.7 Flash的65.3%和Claude Sonnet 5的53.8% [10] - Terminal-bench 2.1终端编码测试达89.4%,超过Gemini 3.7 Flash的85.8%和Claude Opus 5的89.1% [10] - Terminal-bench 4.0通用Agent能力达19.1%,较Gemini 3.7 Flash的11.2%提升显著 [10] - HLE-Verified多学科专家推理测试达54.9%,超过Gemini 3.7 Flash的53.6%和Claude Opus 5的54.4% [10][13] - CharXiv复杂图表推理测试达86.2%,超过Gemini 3.7 Flash的84.5%和Claude Opus 5的83.7% [10] - LVBench长视频理解测试达87.8%,超过Gemini 3.7 Flash的85.4% [10] - OSWorld-2.0 Agentic计算机使用测试达59.0%,超过Gemini 3.7 Flash的50.6% [10] 专业领域应用 - Vals Finance Agent v2金融分析任务达61.4%,超过Gemini 3.7 Flash的59.0%和Claude Opus 5的58.6% [10][13] - Harvey法律Agent基准测试通过率10.0%,超过Gemini 3.7 Flash的8.8%和Claude Opus 5的6.7% [10][13] - BioMysteryBench生物信息学Human Difficult测试达56.5%,超过Gemini 3.7 Flash的43.5%和Claude Opus 5的49.4% [10] - LABBench2生物学研究任务达86.2%,超过Gemini 3.7 Flash的82.1% [10] 技术实现机制 - 性能提升源于投入更多计算量完成任务,模型执行更多推理步骤并反复调用工具 [17] - 在更高推理强度设置下可能消耗更多Token,开发者可选择较低推理强度或继续使用Gemini 3.7 Flash [17] 网络安全专用模型 - CyberGym漏洞发现基准测试中,Gemini 3.8 Flash Cyber展现前沿水平的自主漏洞发现能力 [19] - 内部基准测试覆盖20种编程语言,漏洞发现成功率超过70% [25][26] - CWE-Bench补丁修复测试中Pass@1成功率达47.2%,接近领先前沿模型的47.8%但成本显著更低 [30] - Chrome安全团队发现该模型为Chrome漏洞生成的正确修复补丁数量比规模更大的商业模型提升2.6倍 [35] - Wiz内部渗透测试中漏洞发现召回率提升7.5%至9.7%,成本降低2.3至5.2倍 [35] - Google云漏洞研究团队利用该模型在不到2小时内发现关键基础漏洞,此前通常需要数月 [35] 行业影响与评价 - Aigora.ai CEO称Gemini 3.8 Flash具备Opus 5级别的代码质量,但成本只需一小部分且速度非常快 [8] - 谷歌DeepMind核心成员表示这对递归自我改进是一次巨大飞跃 [7] - 谷歌已开始使用Gemini 3.8 Flash Cyber保护公司内部代码安全 [31]