Claude Opus 4.8登顶ScienceQA|xbench快报
红杉汇·2026-06-01 08:03

文章核心观点 - Anthropic公司于2026年5月29日发布了新一代旗舰模型Claude Opus 4.8,其核心定位是在保持价格不变的前提下,提供跨基准的全面性能提升与更高的工作可靠性 [1] - 该模型在推理、编程及知识工作等优势领域表现突出,特别是在ScienceQA基准测试中以76.4分登顶,且性价比远超主要竞争对手 [2][4] - 然而,其视觉理解能力仍是短板,在BabyVision基准测试中仅得23.45%,显著落后于行业领先模型 [2][10] - 本代升级重点聚焦于提升模型的诚实度(可靠性)和扩展Agentic任务的处理规模,而非单纯追求基准测试分数 [1][16] 模型发布与定位 - Claude Opus 4.8是Opus 4.7的升级版,标准定价维持输入每百万tokens 5美元、输出每百万tokens 25美元不变 [1][15] - 模型引入了“effort控制”作为默认入口,默认档位为high,用户可按需上调至extra或max以消耗更多tokens换取更优结果 [15] - 其Fast模式价格降至上一代Fast模式的约三分之一,输入每百万tokens 10美元,输出每百万tokens 50美元,速度提升2.5倍 [15] - 公司预告更高阶的Mythos级模型将在数周内向客户开放 [1] 性能表现:科学与推理能力 (ScienceQA) - 在xbench的ScienceQA基准测试中,Claude Opus 4.8以76.4的平均分位列第一,是首个突破75分的模型 [2][4] - 其得分较并列第二的GPT-5.5 Pro和上一代Opus 4.7(均为73.0分)高出3.4分 [2][4] - 模型展现出极高的性价比,完成500道测试题仅花费25.6美元,单题响应时间24.27秒;而GPT-5.5 Pro完成相同测试需花费471.1美元,单题响应时间156.99秒,Opus 4.8的成本约为对手的1/18,速度约快6.5倍 [2][5] - 从历史趋势看,Claude模型在ScienceQA上的能力提升显著,从Claude 3.7 Sonnet的46.6分提升至Opus 4.8的76.4分,累计提升近30分 [8] - 模型稳定性增强,其平均分(76.4)与五次测试最佳得分(BoN,84.0)之间的差距从Claude 3.7 Sonnet的25.4分收窄至Opus 4.8的7.6分 [8] 性能表现:视觉理解能力 (BabyVision) - 视觉理解是Claude Opus 4.8的短板,在BabyVision基准测试中得分为23.45%,在19个模型中位列中游 [2][10] - 其得分远低于榜首的Doubao-Seed-2.0-pro(62.60%),差距达39.15个百分点,也大幅落后于Gemini 3.5 Flash(61.86%)和GPT-5.5(54.64%) [10] - 相较于自家前代模型,视觉能力提升有限,Opus 4.8仅比Opus 4.7(22.94%)微增0.51个百分点 [13] 技术升级与特性 - 诚实度(可靠性)重点优化:模型在发现自身代码存在缺陷时选择隐瞒或未主动指出问题的概率,已降至上一代的约1/4 [1][16] - 强化Agentic Computer Use:模型在Online-Mind2Web基准测试上的表现达到84% [1][16] - 推出Dynamic Workflows(研究预览版):该功能面向企业级客户,可在单个会话中规划并运行数百个并行子Agent,以完成如跨数十万行代码的代码库级迁移等复杂任务 [16] - Computer Use功能进一步整合进主模型,延续了公司将此能力内置而非拆分为独立模型的开发路线 [16]

Claude Opus 4.8登顶ScienceQA|xbench快报 - Reportify