核心观点 Meta通过持续迭代Muse Spark 1.3模型,在Coding和Agent领域取得显著进展,以极低成本与顶级模型竞争,验证了其去年重金组建的超级智能团队的投资回报 模型性能与竞争格局 - Muse Spark 1.3在Artificial Analysis榜单获得62分,与Fable 5、5.1 xhigh持平[2][3] - 在Coding和Agent细分领域,Muse Spark 1.3开始在综合评分更高的Opus5 max面前冒头[6] - 在GDPVal-AA v2知识工作基准测试中,Muse Spark 1.3 Max得分1754,高于GPT 5.6 Sol Max的1710,低于Opus 5 Max的1824[7] - 在JobBench专业工具使用测试中,Muse Spark 1.3 Max得分64.9,高于GPT 5.6 Sol Max的45.4,接近Opus 5 Max的65.7[7] - 在OSWorld 2.0 Agentic计算机使用测试中,Muse Spark 1.3 Max得分66.9,高于GPT 5.6 Sol Max的62.7,低于Opus 5 Max的68.3[7] - 在DeepSearchQA Agentic浏览测试中,Muse Spark 1.3 Max得分89.4,低于GPT 5.6 Sol Max的93.0和Opus 5 Max的90.4[7] - 在DeepSWE v1.1长程Agentic编码测试中,Muse Spark 1.3 Max得分75.4,高于GPT 5.6 Sol Max的73.0和Opus 5 Max的74.0[7] - 在Terminal-Bench 2.1 Agentic终端编码测试中,Muse Spark 1.3 Max得分88.8,与GPT 5.6 Sol Max持平,高于Opus 5 Max的86.7[7] 模型迭代与成本优势 - Muse Spark 1.3于9月2日发布,是今年4月亮相后的第四个版本[11][12][13] - 4月初代Muse Spark,7月1.1,8月1.2,9月1.3[13] - 小扎称Muse Spark 1.3是Coding和Agent工作幅度最大的一次提升[14] - 相比1.2版本,Muse Spark 1.3平均减少约20%的工具调用和25%的Token消耗,减少无效轮次,在长程任务中更好记住初始要求[16] - 标准API价格与1.2保持一致:输入1.25美元/百万Token,输出4.25美元/百万Token,缓存输入0.15美元[24] - Artificial Analysis计算,1.3 xhigh每个Intelligence Index任务成本约0.55美元[24] - 同一档次的GPT-5.6 Sol Max和Grok 4.6 High分别约0.95美元和0.94美元[25] - 网友实测显示,同Prompt生成3D维京手办,1.3成本0.08美元,1.2成本0.1美元,但1.3细节质感更高[20] - 另一实测中,Muse Spark 1.3连续运行20轮自我改进,每轮启动3个Agent,共60+次Agent运行,全程花费不到1美元[22] 团队背景与研发进展 - Meta去年组建超级智能实验室,从OpenAI挖来赵晟佳、余家辉、任泓宇、毕树超等研究员[30][31] - 核心研究员余家辉曾宣布离开Meta创业,引发外界对团队稳定性的关注[9][32] - 赵晟佳称Muse Spark 1.3是目前Spark模型线最强的Coding和Agent模型[36] - 赵晟佳特别提到三个方向:更长程的工作、更强的Agent任务能力、更可靠地遵循复杂指令[37] - 毕树超披露团队在训练阶段投入更多算力进行结果评分矫正[39] - 针对性解决模型偷懒划水、指令执行偏差、含糊回避作答、奖励投机、奖励黑客等问题[40] - Muse Spark是Muse系列里更轻量的模型线,后面还有更大的模型[26] - 小扎预告Muse Spark开放权重即将到来,以及尚未发布的更大模型[27]
Meta新模型逼平Fable 5,小扎:开源且便宜到你懒得算账