Workflow
HarnessEval
icon
搜索文档
开启Benchmark的Harness时代:15家学术机构联合发布HarnessEval
机器之心· 2026-08-18 18:45
核心观点 - 行业正从评估单一模型转向评估复杂AI系统,需要一种全新的评测范式,即从静态指标(Metric)转向可执行的评测系统(Harness)[3][6][35] - MirroS联合清北、Berkeley、MIT、xbench、英伟达等机构发布HarnessEval,旨在为评测系统本身建立一套可规划、可调用、可验证的工作流[3][4][35] - 评测系统应具备理解、规划、调查和验证的能力,最终输出可追溯的证据树(evidence tree),而不仅仅是分数[10][19][28] 为什么需要Harness - Agent的最终能力不等于底层模型能力,还包括上下文管理、工具调用、记忆、任务拆解、执行环境、权限管理和结果验证等组件[2] - 决定Agent能否稳定完成复杂任务的是这些组件能否被组织成一套稳定、可执行的工作流系统[2] - Harness描述的正是这一层负责规划、协调与验证的系统层能力[3] 传统评测的局限性 - 传统benchmark依赖固定评测流程:一组测试数据、一套固定rubric、若干指标和聚合分数[9] - 不同案例真正需要检查的问题不同,统一Rubric要么覆盖过全面包含无关检查,要么简化后遗漏关键判断[9] - 传统评测方式适合边界清晰、答案确定的任务,但Agent与交互式生成系统不再是一次性的输入输出映射[8] - Agent可能读取文件、检索网络、执行代码、传递状态、拆解长期任务、调度多个sub-agent[8] HarnessEval的核心机制 - 评测智能体首先理解案例上下文与评测意图,再从可复用的Skill Library中选择适用技能[14] - 每个高层问题被拆解为可测量的子问题,交给不同的sub-agent或诊断工具执行[14] - 主智能体验证返回证据是否充分、各项判断是否真正回答了原问题,最后完成聚合与评分[14] - 整个过程分为四个阶段:Plan(先理解案例再决定测什么)、Route(选择适用技能而非跑完所有指标)、Decompose(把抽象判断拆成可验证证据)、Verify(先审计证据再交付分数)[16][17][18] - 最终输出一棵完整的evidence tree,记录测了什么、为什么要测、调用了什么工具、找到了什么证据,以及这些证据如何支持最终结论[19] HarnessEval-W:世界模型试验场 - HarnessEval首先落地于交互式世界模型,因为评估生成世界比判断文本正确性困难得多[25] - 一段视频可能画面精美却执行错误动作,完成眼前变化却遗忘整个场景,产生合理运动却违反接触关系、速度变化或因果顺序[25] - 现有自动化评测往往只能粗粒度衡量画面质量、运动流畅度或文本匹配度,难以回答涉及交互、时序与因果的问题[25] - Mirros开源HarnessEval-w,从观测质量、状态转移正确性和世界持续性三个维度组织评测[25] - 每个Skill被拆解成一系列更容易被验证、被解释的子问题,例如检查目标是否真实存在且清晰可见、变化是否发生在正确对象上、预期状态是否最终成立、关键场景锚点是否保持、过程中是否出现无关变化[27] - 面对物理碰撞,系统可能调用目标追踪、时间交叠验证、速度估计与因果顺序检查[27] 评测形态的升级意义 - Benchmark的核心资产将从数据与指标扩展到技能路由、工具调用、证据验证和持续生长的Skill Library[32] - 模型可以通过test-time scaling提升能力,评测器也应投入更多计算进行更深入的搜索与验证[32] - 不同任务需要不同的评测Skill,通过按需组合专业能力,Eval才能覆盖代码、搜索、机器人、世界模型等复杂场景[32] - 评测结果将从单一score走向可追溯的evidence,当系统遇到能力边界之外的问题时,应主动暴露自身的技能与证据缺口[32] - Benchmark不再是一套固定规则,而成为能够持续扩展和自我完善的living system[32] 通向RSI(递归式自我改进) - 当AI逐步走向RSI,评测就不再只是模型之外的一把尺子,而会成为自我改进闭环中的关键反馈[34] - 评测关注什么,模型就会朝什么方向优化;评测忽略什么,系统也可能在反复迭代中放大什么[34] - 没有可靠的Eval,RSI就可能失去方向[34] - 世界模型是MirroS选择的第一块试验场,也是迈向Physical RSI的重要一步[34] - 未来Eval不仅要理解上下文、规划评测、组合技能、调度工具和验证证据,还要审视自身、发现能力缺口,并与被评模型共同进化[34]