AI应用进行时:Grok4.5发布,看好模型商业化继续加速
长江证券·2026-07-22 17:40

行业投资评级 - 投资评级为“看好”,并维持该评级 [9] 报告核心观点 - 事件:2026年7月9日,SpaceXAI发布与Cursor联合训练的旗舰模型Grok 4.5,该模型参数为1.5T,采用MoE架构,支持最高50万上下文,重点面向编程、Agent和知识工作场景,并支持视觉输入 [2][7] - 核心观点:AI正在从开发者场景向更广泛的企业生产力场景渗透,商业化空间进一步打开,当前时点继续看好AI商业化进展,关注下半年模型范式迭代与场景加速渗透带来的商业化斜率变化 [12] 模型性能与工程能力 - 在SWE Bench Pro测试中得分64.7%,超过GPT-5.5(58.6%)和Opus 4.7(64.3%),接近Opus 4.8(69.2%)[12] - 在Terminal Bench 2.1测试中得分83.3%,与GPT-5.5差距仅0.1% [12] - 在DeepSWE 1.0测试中得分62.0%,超越Opus 4.8(55.75%),接近GPT-5.5(64.31%)[12] - 在GDPval-AAv2 Leaderboard中得分1543分,排名第四;在Harvey法律智能体基准测试中位列第一 [12] - 马斯克表示“Grok 4.5大致相当于Opus 4.7,但快得多” [12] 效率与成本优势 - 推理速度达到80 TPS,跻身第一梯队 [12] - Token效率显著:在SWE Bench Pro任务中,Grok 4.5平均输出15,954个Token,而Opus 4.8需要67,020个Token,节约Token约4.2倍 [12] - 定价为输入$2/百万token、输出$6/百万token,比Opus系列和GPT-5.5便宜60%以上 [12] - 每项GDPval任务成本仅$0.49,比榜首模型便宜近90% [12] - 未来内部针对GB300优化的推理栈上线后,模型运行速度有望翻倍甚至更高 [12] - 非顶尖梯队玩家正通过低价策略抢占自身场景用户的数据闭环,效率优先策略有望打开更多对成本敏感的规模化部署场景 [12] 训练范式与垂直整合 - 预训练基于数万张GB300 GPU完成,针对超大规模训练进行稳定性优化,同时提高数据密度和质量 [12] - 强化学习扩展到了数十万个真实的软件工程和知识工作任务,受益于引入数万亿Token规模的Cursor数据,模型学到的是完整软件开发流程而非单纯代码生成 [12] - SpaceXAI构建了从算力(Colossus超算)、数据(Cursor生态)、应用(特斯拉/SpaceX内部工程团队)到模型(Grok 4.5)的整合版图,这种一体化的整合能力是其独到之处 [12] 未来工作范式展望 - 未来大概率是模型分层、Multi-Agent部署的工作范式,大多数任务不需要Fable级别的性能,更可能是“Grok负责执行开发,再交给Fable做代码审计” [12]

AI应用进行时:Grok4.5发布,看好模型商业化继续加速 - Reportify