后训练
搜索文档
AI产业研究系列:模型跟踪:后训练驱动能力跃升,性价比重塑格局
国盛证券· 2026-08-18 21:48
报告行业投资评级 - 行业评级为“增持(维持)” [5] 报告核心观点 - Grok 4.6 后训练驱动能力跃升,性价比重塑格局 [1] - 模型能力跃升主要来自后训练阶段的策略优化,而非参数规模扩张 [3] - API 价格仅为同梯队前沿模型的一半左右,长程任务平均成本不足 1 美元,性价比优势明显 [3] - 同步推出 AI 代理产品 Grok Bot,标志公司从模型供应商向企业 AI 平台转型 [4] 根据相关目录分别总结 模型能力与评测表现 - Grok 4.6 为 1.5 万亿参数模型,在 Grok 4.5 基础上加大了对长程智能体任务的训练投入 [2] - 在由九项基准测试汇总的综合智能指数中获得 61 分,与 OpenAI 当前最强旗舰模型持平,仅落后 Anthropic 两款旗舰模型(62 分、63 分),处于全球第一梯队 [2] - 在高价值职场任务评测中,Grok 4.6 以 1753 分居于对比模型前列,仅落后 Claude Opus 5 [2] - 在编程能力评测中,Grok 4.6 以 69.9% 的成绩领先 OpenAI 旗舰模型 [2] - 综合智能指数较前代提升 5 分,编程与智能体能力跻身行业第一梯队 [3] 能力跃升驱动力 - 能力跃升主要来自后训练阶段的策略优化,而非参数规模扩张 [3] - 继 GLM-5.3、DeepSeek V4-Flash 之后,Grok 4.6 在参数规模不变的情况下实现能力提升 [3] - 后训练阶段的数据筛选与训练策略精细化,正成为驱动模型能力跃升的核心动能 [3] - 行业竞争重心已从规模转向训练效率 [3] 性价比与定价策略 - Grok 4.6 的 API 定价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,较 Anthropic 与 OpenAI 旗舰模型低 60% 以上 [3] - 在长程知识工作评测中,Grok 4.6 平均约 53 轮即可完成任务,而 Anthropic 旗舰模型需约 103 轮 [3] - 输入消耗仅为后者的四分之一,单任务平均成本约 0.84 美元 [3] - 在长程智能体与成本敏感的规模化部署场景中,Grok 4.6 以不足竞品一半的单位成本实现第一梯队能力 [3] 产品与生态布局 - 同步推出 AI 代理产品 Grok Bot,将 Grok 4.6 封装为可自主执行任务的“AI 队友” [4] - Grok4.6 于 8 月 11 日发布测试版,拥有独立云端计算环境,可登录用户现有工具自主执行任务、完成后才返回汇报 [4] - 目前 Grok 4.6 已接入 Cursor 与 Grok Build [4] - Grok Bot 将模型能力封装为企业级智能体服务,并通过 Cursor 补齐开发者生态短板 [4]