说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。
数字生命卡兹克·2026-08-17 08:11

核心观点 - 当前大模型在Coding等标准化任务上表现优异,但在真实世界工作任务中成功率极低,存在显著的“评测-体验鸿沟”[5][55] - 真实工作任务评测集稀缺,现有模型在电商、生活服务等领域的任务通过率普遍不及格,与Coding领域的体感完全不同[5][20][21] 真实工作任务评测现状 - 作者认为模型在真实工作中的实际完成效果评测最为稀缺,如金融、法律、电商、生活等领域,直接给模型一份真实工作从头干到尾,更符合用户日常工作和生活[5] - 作者翻遍几乎所有评测集,发现真实场景下的评测集寥寥无几,绝大多数模型在这些任务上的成功率低得可怜[5] - 现有评测集更偏向研究,更新不够及时,新模型发布后需很久才能更新,无法放入AIHOT排行榜[53] RealReplicaBench电商评测 - 该评测集由阿里国际站团队开源,基于其电商Agent产品Accio Work的真实数据[6] - 从约160万条完整对话中整理出20万条工作流,归纳出约2000条商业价值高的,最终按可复现性和结果可判定性整理出107个任务[6] - 覆盖电商领域全部工作场景:供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等[9] - 任务分为四大类:API/MCP(10项)、Browser(28项)、CLI(53项)、File(16项)[7] - 任务示例包括:上线定制瑜伽垫(需从多家供应商报价和实拍图片中选品发布)[11][12]、规划东莞到达拉斯电子产品运输路线(计算保险、清关、海关担保和平台费)[12][13]、处理电商退货争议(综合订单记录、物流扫描、质检、客户对话等逐单决策)[15]、跨平台月度对账(清洗天猫、京东、拼多多三套格式不同的订单)[16] 模型表现 - 在PI开源Harness框架下测试,排名第一的Claude Opus 5通过率60.75%,完成65/107个任务,每任务成本$1.79,耗时7分48秒[17][18] - Qwen 3.8 Max和DeepSeek V4 Pro以49.53%通过率并列第三,均完成53/107个任务[19] - 大部分模型任务通过率连50%都过不去,107个任务中有一半全失败[20] - 使用Accio框架后通过率整体提升,50%以上通过率的模型从2个增加到6个,Claude Opus 5提升至61.68%[37][38] 评测方法 - 评测程序直接检查邮箱、草稿、日历和JSON文件的最终状态,共23组、42项结果检查[35] - 23组全部通过才算答对得1分,有一项检验错误即0分,没有过程分[37] - 以供应商采购题为例:模型需从约300封邮件中还原项目需求,从20家供应商中找出合格且成本最低的,进行标签、标记可疑邮件、保存草稿、创建会议、交付JSON总结等操作[24][25][26][27] - 项目需求散落在10封邮件中,中途多次更改数量和要求,供应商需综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对[29][30] E-Bench评测 - 由腾讯混元联合清华大学和东南大学发布,模拟王者荣耀、QQ音乐和腾讯会议3个产品场景[43] - 共设置323个需要模型真实操作的任务,如整理好友、搜索歌曲、筛选参会人员等[44] - 共测试11个模型,成绩最好的Kimi-K3的Avg@3为73.79%[45] - 同一道题独立运行3次全部做对的稳定性指标,表现最好的Kimi-K3仅58.82%[46] - 11个模型在稳定性指标上均未过60%[47] VibeLifeBench生活评测 - 由小红书dots团队发布,包含200个持续时间数周的生活任务,覆盖职业、健身、租房、购物和差旅等10个领域[49][50] - 指出现有benchmark建立在三个与真实世界不符的假设上:用户会把需求说清楚、一次交互就能结束、世界是静止的[49] - 成绩最好的Claude Opus 5的avg@3仅32.5%[51] 行业对比与展望 - 在Coding任务上,DeepSWE评测基准(113个任务)中,排名靠前的模型通过率均超70%,Claude Opus 5达74%[41][42] - 真实工作任务与Coding任务表现差距巨大,模型在大量真实工作场景中还有极大进步空间[55] - 纯靠模型公司不够,需要所有厂商一起努力,如Accio将持续提炼真实工作任务并滚动更新开放评测集[52] - 作者计划收集RealReplicaBench、E-Bench、VibeLifeBench等真实世界工作评测集,自建环境自费跑分,保持更新并放入AIHOT排行榜[53]

说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。 - Reportify