Muse Spark 1.3
搜索文档
Meta Rises 4% as Muse Spark 1.3 Claims Parity With Anthropic and OpenAI
247Wallst· 2026-09-04 02:48
核心观点 - Meta Platforms发布Muse Spark 1.3 AI模型,声称性能与Anthropic和OpenAI的顶级模型持平,推动股价上涨4%[1][3][4] 市场表现 - Meta Platforms股价上涨4%至614.57美元,此前年初至今下跌10%[4] - SPDR S&P 500 ETF信托上涨1%至773.75美元,市场热情集中在Meta而非整体大盘[4] - Alphabet股价上涨2%至342.61美元,Reddit股价下跌1%至156.49美元[5] 模型发布与性能 - Muse Spark 1.3是Meta Platforms最新前沿模型,升级了代理和编码能力,通过Muse Code和Meta Model API推出,最大推理模式待安全测试完成后发布[6] - Meta AI负责人Alexandr Wang称Muse Spark 1.3是公司迄今为止最大的模型性能提升,已与Anthropic和OpenAI的产品持平[7] - 开发者已可访问并付费使用该模型,后续将整合至Meta社交应用和Meta AI助手[7] - 公司路线图包括更大模型和最终开源权重发布,保持封闭和开放生态系统的双重选择[7] 财务与竞争背景 - Meta Platforms 2026年第二季度营收608亿美元,同比增长28%,但稀释每股收益6.18美元低于预期的7.22美元,因法律和遣散费压缩营业利润率[9] - 该业绩miss结束了连续六个季度的超预期记录,使股价承压,今日上涨被视为AI故事的重新设定[9] - Alphabet第二季度Google Cloud营收增长82%,90%的财富100强使用Gemini Enterprise,Gemini App月活用户达9.5亿,Alphabet股价一年回报率60%[10] - Muse Spark 1.3是Meta Platforms缩小与Alphabet竞争差距的希望[10] 业务进展 - CEO Mark Zuckerberg在第二季度电话会议上表示,自Meta AI围绕Muse Spark家族重建以来,每日与助手互动的人数增长了60%[11] - WhatsApp和Messenger上的商业代理每周触达超过100万家企业[11] - 2026年第一季度每股收益10.44美元,远超预期的6.66美元,中期波动更像是长期建设中的一步而非逻辑破坏[11] 未来催化剂 - 独立基准测试结果将决定今日股价走势的持续性,预测市场显示Meta模型在“人类最后考试”中得分55%或以上的概率为0.48,60%为0.255,65%为0.125[12] - 2026年9月23日的Connect活动是下一个预定催化剂,将展示Muse Spark 1.3在消费端应用,包括与EssilorLuxottica合作开发的新AI眼镜[13]
Meta says new Muse Spark 1.3 model rivals Anthropic, OpenAI offerings
Proactiveinvestors NA· 2026-09-03 23:59
公司概况 - Angela Harmantas是Proactive的编辑,拥有超过15年北美股票市场报道经验,尤其专注于初级资源股[1] - 她曾为加拿大、美国、澳大利亚、巴西、加纳和南非等国的领先行业出版物进行报道[1] - 此前她在投资者关系领域工作,并曾为瑞典政府领导加拿大外国直接投资计划[1] 内容定位与覆盖范围 - Proactive为全球投资受众提供快速、可访问、信息丰富且可操作的商业和金融新闻内容[2] - 所有内容由经验丰富且合格的新闻记者团队独立制作[2] - 新闻团队覆盖全球主要金融和投资中心,在伦敦、纽约、多伦多、温哥华、悉尼和珀斯设有分社和演播室[2] - 公司专注于中小型市场,同时也关注蓝筹公司、大宗商品和更广泛的投资故事[3] - 报道领域包括生物技术和制药、采矿和自然资源、电池金属、石油和天然气、加密货币及新兴数字和电动汽车技术[3] 技术应用 - Proactive采用前瞻性技术,人类内容创作者拥有数十年的专业知识和经验[4] - 团队使用技术来辅助和增强工作流程[4] - 公司偶尔使用自动化和软件工具,包括生成式AI[5] - 所有发布的内容均由人类编辑和撰写,符合内容生产和搜索引擎优化的最佳实践[5]
谷歌又发新模型,Meta AI负责人“挑衅”:Gemini是谁啊?
第一财经· 2026-09-03 22:41
谷歌Gemini 3.8 Flash模型更新 - 谷歌于2026年9月2日推出Gemini 3.8 Flash,定位为“最智能的主力模型”,在软件工程、智能体任务及多步骤推理方面较3.7 Flash有所提升 [3] - 同步推出安全模型Gemini 3.8 Flash Cyber,在漏洞检测和自动修补方面具有前沿性能 [3] - 从3.7 Flash更新到3.8 Flash仅用时14天,模型升级周期显著缩短 [3] - 谷歌DeepMind核心成员姚顺宇表示,对模型而言只是一小步,但对RSI(递归自我改进)是一次巨大飞跃 [3] - 在DeepSWE v1.1评测中,3.8 Flash得分73.7%,仅比Claude Opus 5的74%低0.3个百分点,超过GPT-5.6 Sol的72.7%及上代3.7 Flash的65.3% [6][7] - 根据Artificial Analysis测评,Gemini 3.8 Flash智能得分59,比3.7 Flash高3分,目前排在模型榜单第十位 [7] - API价格维持每百万Token输入0.75美元、输出3.75美元,延续低价普及策略 [7] - 模型能力提升源于底层设计调整,处理复杂任务时执行更多步骤推理并以循环迭代方式调用内部工具 [7] - 每项智能指数任务成本为0.58美元,较3.7 Flash价格上涨约40%,因每任务输出token增加30%及智能体评估回合数增多 [7] - 在高难度任务中模型可能消耗额外Token,旨在提高首次成功率并减少死循环重试和人工干预 [8] - 开发者可通过调整思考配置降低消耗,或继续使用Gemini 3.7 Flash [8] - 谷歌产品逻辑为:旗舰未更新,Flash系列既守成本速度基本盘,也顶上原本旗舰的复杂任务 [8] Meta Muse Spark 1.3模型发布 - Meta于同日推出Muse Spark 1.3,对标Opus 5,在榜单中超过Gemini 3.8 Flash [9] - 升级重点放在Agent长任务、编程及推理效率,强调在较长工作流中持续调用工具、修正计划并处理多个并行任务 [9] - 在DeepSWE v1.1上成绩达75.4%,超过Gemini 3.8 Flash [9] - Meta AI负责人Alexandr Wang在社交媒体调侃谷歌,称“Gemini 是谁”,引发争议 [9][11] - 有网友认为这种明确比较“给人小家子气的感觉” [11] - Meta仅发布模型基准数据,未经开发者实际任务检测,Benchmark胜负不能等同于真实世界胜负 [11] 行业趋势与观察 - AI竞赛时间单位已从季度压缩到周 [12] - 对于开发者而言,发布宣传和榜单排名并不重要,需等待社区应用反馈才能评判模型更新是否成功 [12]
昨晚,硅谷经历了AI诸神之战
虎嗅APP· 2026-09-03 22:08
文章核心观点 AI的经济学正在发生突变,智能成本正以极快速度下降,核心计量单位正从“每百万token成本”转向“完成一个真实任务的总成本” [11][13][89] 这一趋势由三方面驱动:模型能力下放至低价区间、Agent效率提升以减少无效消耗、以及模型间通信方式的根本性变革 [87][88] 一、Google Gemini 3.8 Flash:前沿能力下放至低价区间 - Google发布Gemini 3.8 Flash,为六周内第三次更新Flash系列,定位为最强大的推理与代码模型 [16][18] - 核心提升集中在long-horizon coding和agentic workflow,在DeepSWE v1.1上取得约74%成绩,一度登顶世界第一 [21][22][25] - 与竞品能力差距缩小:Claude Opus 5约74%,GPT-5.6 Sol约73%,Fable 5约70% [27] - 关键差异在于成本:Gemini 3.8 Flash API输入0.75美元/1M token,输出3.75美元/1M token [30] - DeepSWE单任务平均成本仅2.36美元,而Claude Opus 5为11.84美元,GPT-5.6 Sol为6.46美元 [31][32] - 同一级别软件工程能力,执行成本可差数倍,这在Agent时代至关重要 [35][36] - 模型遇到复杂任务会主动work harder,因token足够便宜,可允许更长运行循环 [38][39] - 核心意义:将过去只有最昂贵frontier model才能提供的能力,压入Flash的价格区间 [40] 二、Meta Muse Spark 1.3:Agent效率提升与成本优化 - Meta发布Muse Spark 1.3,在DeepSWE v1.1上取得75.4%成绩,超越Gemini 3.8 Flash、Claude Opus 5和GPT-5.6 Sol [43][44] - 从1.2到1.3版本,成绩从约55%提升约20个百分点至75.4% [45][46] - 更关键的两个数字:工具调用减少约20%,token消耗减少约25% [48] - 模型强化了在长线程中维护多个workflow、遇到模糊任务主动询问、解决不了主动求助、不可逆操作先确认等能力 [53] - 长任务运行多轮后更不易忘记初始约束,强调模型对自身能力边界的认识 [53][54] - 这些能力在Agent时代可直接换算成钱:Agent少犯一次错误,本身就是一次推理优化 [57][58] - 行业竞争计量单位正从“一百万token多少钱”转向“把一个真实任务从头跑到尾,到底多少钱” [59] 三、Mostik:颠覆性模型间通信方式 - 初创公司Mostik登上WIRED专访,尝试让两个AI模型不再通过自然语言互相交流 [5][62] - 当前Multi-Agent系统低效:模型A生成几百上千token自然语言,模型B再全部读入重新理解 [63] - 类比为“电脑A把文件打印成几百页纸,电脑B用摄像头一页页OCR回去” [64] - Mostik试图在不同模型内部表示间建立Bridge,直接交换latent representation [66] - 实验将完整版GLM-5.2 753B与仅4B的Qwen 3.5桥接,混合系统推理成本仅为完整GLM-5.2的1/20 [68][69] - 挑战在于不同模型架构、参数、训练数据和内部坐标系不同,缺乏成熟数学语言描述共同表示 [71][72] - 1/20的数字引发对未来AI架构的思考:设备端可能只需运行0.xB或几B的小模型 [73][77][78] - 小模型负责高频廉价持续运行,云端frontier model负责低频困难推理,中间通过Bridge高效通信 [82] - 未来可能只需传输高度压缩的latent state,而非重新发送十万token的Context [80][81] - 推理成本下降幅度可能远超今天API降价30%或50%,将改变组织AI计算的方式 [83][84] 四、行业趋势与影响 - 智能正以非常夸张的速度变得便宜,降价已不止API单价下降 [89][90] - 模型价格下降、完成任务所需计算量下降、模型间信息交换方式被重新设计 [90] - 技术真正爆发发生在“终于便宜到可以随便用”的时候 [92] - 今天Agent花几十美元完成小任务不划算,未来只需几毛钱,许多应用将成立 [93][94] - 今天不可能让几十个Agent 24小时围绕一个人运行,推理成本再下降一两个数量级可能成为默认状态 [95]
Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账
量子位· 2026-09-03 10:56
核心观点 Meta通过持续迭代Muse Spark 1.3模型,在Coding和Agent领域取得显著进展,以极低成本与顶级模型竞争,验证了其去年重金组建的超级智能团队的投资回报 模型性能与竞争格局 - Muse Spark 1.3在Artificial Analysis榜单获得62分,与Fable 5、5.1 xhigh持平[2][3] - 在Coding和Agent细分领域,Muse Spark 1.3开始在综合评分更高的Opus5 max面前冒头[6] - 在GDPVal-AA v2知识工作基准测试中,Muse Spark 1.3 Max得分1754,高于GPT 5.6 Sol Max的1710,低于Opus 5 Max的1824[7] - 在JobBench专业工具使用测试中,Muse Spark 1.3 Max得分64.9,高于GPT 5.6 Sol Max的45.4,接近Opus 5 Max的65.7[7] - 在OSWorld 2.0 Agentic计算机使用测试中,Muse Spark 1.3 Max得分66.9,高于GPT 5.6 Sol Max的62.7,低于Opus 5 Max的68.3[7] - 在DeepSearchQA Agentic浏览测试中,Muse Spark 1.3 Max得分89.4,低于GPT 5.6 Sol Max的93.0和Opus 5 Max的90.4[7] - 在DeepSWE v1.1长程Agentic编码测试中,Muse Spark 1.3 Max得分75.4,高于GPT 5.6 Sol Max的73.0和Opus 5 Max的74.0[7] - 在Terminal-Bench 2.1 Agentic终端编码测试中,Muse Spark 1.3 Max得分88.8,与GPT 5.6 Sol Max持平,高于Opus 5 Max的86.7[7] 模型迭代与成本优势 - Muse Spark 1.3于9月2日发布,是今年4月亮相后的第四个版本[11][12][13] - 4月初代Muse Spark,7月1.1,8月1.2,9月1.3[13] - 小扎称Muse Spark 1.3是Coding和Agent工作幅度最大的一次提升[14] - 相比1.2版本,Muse Spark 1.3平均减少约20%的工具调用和25%的Token消耗,减少无效轮次,在长程任务中更好记住初始要求[16] - 标准API价格与1.2保持一致:输入1.25美元/百万Token,输出4.25美元/百万Token,缓存输入0.15美元[24] - Artificial Analysis计算,1.3 xhigh每个Intelligence Index任务成本约0.55美元[24] - 同一档次的GPT-5.6 Sol Max和Grok 4.6 High分别约0.95美元和0.94美元[25] - 网友实测显示,同Prompt生成3D维京手办,1.3成本0.08美元,1.2成本0.1美元,但1.3细节质感更高[20] - 另一实测中,Muse Spark 1.3连续运行20轮自我改进,每轮启动3个Agent,共60+次Agent运行,全程花费不到1美元[22] 团队背景与研发进展 - Meta去年组建超级智能实验室,从OpenAI挖来赵晟佳、余家辉、任泓宇、毕树超等研究员[30][31] - 核心研究员余家辉曾宣布离开Meta创业,引发外界对团队稳定性的关注[9][32] - 赵晟佳称Muse Spark 1.3是目前Spark模型线最强的Coding和Agent模型[36] - 赵晟佳特别提到三个方向:更长程的工作、更强的Agent任务能力、更可靠地遵循复杂指令[37] - 毕树超披露团队在训练阶段投入更多算力进行结果评分矫正[39] - 针对性解决模型偷懒划水、指令执行偏差、含糊回避作答、奖励投机、奖励黑客等问题[40] - Muse Spark是Muse系列里更轻量的模型线,后面还有更大的模型[26] - 小扎预告Muse Spark开放权重即将到来,以及尚未发布的更大模型[27]
谷歌邪修Gemini 3.8 Flash!险胜DeepSeek,姚顺宇:RSI一大步
量子位· 2026-09-03 08:32
核心观点 - 谷歌发布Gemini 3.8 Flash,Coding能力大幅提升,在LMArena Agent榜单空降第14名,以微弱优势险胜DeepSeek-V4-Pro[2] - 该模型定价与3.7 Flash保持一致,未涨价[4][5] - 谷歌采用“多步骤循环”策略弥补模型智能不足,与OpenAI和Anthropic追求更少步骤完成任务的路径不同[9][10][11] - 3.8 Flash是市面上输出最快的模型,速度比第二名Meta高近一倍[14] - 谷歌六周内连出三款Flash模型,人事变动频繁,包括二进制能力拥有者Jeff Dean离职[21] - 同时Meta发布Muse Spark 1.3,对标Opus 5,Agent和Coding能力大幅提升[50] 性能与基准测试 - DeepSWE v1.1长周期软件工程任务得分73.7%,高于3.7 Flash的65.3%,接近Claude Opus 5的74.0%[27] - Terminal-bench 2.1 Agentic终端编码得分89.4%,高于3.7 Flash的85.8%[20] - Terminal-bench 4.0通用Agent能力得分19.1%,高于3.7 Flash的11.2%,但远低于Claude Opus 5的51.8%和GPT-5.6 Sol的37.3%[20] - HLE-Verified多学科专家推理得分54.9%,高于3.7 Flash的53.6%[27] - CharXiv复杂图表推理得分86.2%,高于3.7 Flash的84.5%[27] - LVBench长视频理解得分87.8%(Agentic模式)和87.1%(静态模式),高于3.7 Flash的85.4%[27] - OSWorld-2.0 Agentic计算机使用得分59.0%,高于3.7 Flash的50.6%[27] - BioMysteryBench生物信息学研究工作流Human Solvable得分88.8%,Human Difficult得分56.5%,均高于3.7 Flash的87.1%和43.5%[27] - LABBench2生物学真实研究任务得分86.2%,高于3.7 Flash的82.1%[27] - GDP.PDF Expert PDF文档理解得分35.0%,略高于3.7 Flash的34.0%[27] 企业级Agent场景 - 金融领域Vals Finance Agent v2得分61.4%,高于3.7 Flash的59.0%,并超过Claude Opus 5的58.6%和GPT-5.6 Sol的53.8%[27] - 法律领域Harvey's Legal Agent Benchmark复杂法律工作流全部通过率10.0%,高于3.7 Flash的8.8%,并超过Claude Opus 5的6.7%和GPT-5.6 Sol的2.5%[27] - GDPVal-AA v2知识工作Elo评分1545,高于3.7 Flash的1482[27] 定价与成本 - 输入价格$0.75/百万Token(常规$1.50),输出价格$3.75/百万Token(常规$7.50),与3.7 Flash一致[27] - 相比Claude Opus 5输入$5.00/百万Token、输出$25.00/百万Token,成本优势显著[27] - 相比GPT-5.6 Sol输入$4.00/百万Token、输出$20.00/百万Token,成本更低[27] 网络安全模型3.8 Flash Cyber - 谷歌史上最强网络安全模型,专攻自主发现漏洞和自动生成补丁[38] - CyberGym漏洞发现测试超过3.5 Flash Cyber和其他前沿模型[38] - 覆盖20种编程语言的内部代码库测试,挖洞成功率超过70%[38] - CWE-Bench修洞pass@1达到47.2%,接近前沿模型的47.8%,成本低出一大截[42] - Chrome安全团队使用后,产出的正确补丁数量是最强商业模型的2.6倍[45] - Wiz内部渗透测试召回率提升7.5到9.7个百分点,花费仅为其他前沿模型的2.3到5.2分之一[46] - Google Cloud漏洞研究团队不到两小时挖出以往需研究数月的关键基础漏洞[47] - 该模型不公开发布,仅通过Fairwind计划向受信防御者开放[48][49] 潜在风险与争议 - 有网友指出模型在Terminal-bench 4.0等新基准上表现不佳,怀疑是刷分结果[19] - 智能方面未见本质提升,高分可能依赖多步骤推理和反复迭代调用工具,消耗更多Token[31][32][33] - 实际使用效果存疑,若智能水平不足,可能输出大量劣质Token[15][16]
早报 | 苹果官方账号已取关库克;星宇股份董事长回应解约应届生;马斯克称十年内机器人产出超全人类;本田中国回应要供应商大幅降价传闻
虎嗅APP· 2026-09-03 08:18
科技与AI行业 - Meta发布迄今最强大AI模型Muse Spark 1.3,开发者可付费使用,在编程任务上优于GPT-5.6 Sol,但OpenAI将推新模型Astra [5] - OpenAI计划推出AI模型Astra,前期仅限部分测试人员执行高级网络安全任务,后续通过“Daybreak Blue”计划开放 [6][7] - 马斯克在G20预测AI每年为全球经济增加20万亿至30万亿美元,十年内人形机器人数量超10亿台,每台产出至少为人类5倍,但2027年AI芯片将面临至少15吉瓦电力缺口 [28] 苹果公司 - 苹果官方账号取关库克,仅关注现任CEO特努斯1人 [8] - 蒂姆·库克卸任苹果CEO,转任董事会执行主席,CEO由约翰·特努斯接任 [8] - 新任CEO特努斯基础年薪300万美元,并将在2027财年获得目标价值5500万美元年度股权奖励,其中75%为绩效型限制性股票 [8] 中际旭创 - 自然人股东章建平退出中际旭创前十大股东名单,截至2026年8月31日,此前半年报中章建平持有593万股,持股比例0.53% [9] - 截至8月31日,中际旭创第十大股东持股数量756万股,持股比例0.64%,不能确定章建平近期是否有减持 [9] 雀巢集团 - 雀巢集团以10亿美元出售旗下7个保健品品牌,包括Nature's Bounty、Osteo Bi-Flex、Ester-C等,以及相关美国自有品牌补充剂业务和制造设施 [10] 追觅科技 - 追觅科技创始人兼CEO俞浩微博账号在禁言近三个月后疑似解封,但其视频号、小红书停更约一个月,抖音停更超三个月 [11] 星宇股份 - 星宇股份董事长周晓萍回应“解约应届生”舆情,公司已公开发布致歉信并正在政府指导下落实相关措施,对不实报道已投诉举报 [15] 本田中国 - 本田中国回应要求供应商大幅降价传闻,称非官方发布,公司一直与供应商共同创新合作开展成本优化活动 [15] 胖东来 - 胖东来供应商准入标准中,员工待遇为重要审核标准,招商初筛表必填字段包括员工总人数、社保缴纳人数、月均工资、周度平均出勤天数、日均工作时长等 [16] 特斯拉 - 特斯拉于9月3日在得州奥斯汀举行Cybercab Robotaxi全球首发发布会,该车为全球首款量产无方向盘、无踏板L5级自动驾驶出租车 [21][22] - 目标售价低于3万美元,每英里运营成本约0.2美元 [23] 动力电池行业 - 2026世界动力电池大会9月3-4日在四川宜宾举办,主题“电驱万物 融合共生”,将发布《动力电池产业发展指数(2026)》《动力电池技术路线图》等成果 [24] - 大会聚焦体系安全、前沿技术、产业转型、新型储能、电池回收等议题 [25] 低空经济行业 - 第五届低空经济发展大会9月3-5日在芜湖举办,主题“共创安全低空新生态,打造高质量发展新支柱” [26] - 首次采用室内+室外真机双线展览模式,eVTOL飞行器、飞行汽车等前沿产品集中亮相 [27]