Workflow
Long-horizon tasks in AI
icon
搜索文档
Nvidia just showed that the harness, not the AI model, is now the real hero
TechCrunch· 2026-08-22 03:43
核心观点 - 英伟达研究表明,对于AI执行长周期任务,定制化“harness”(模型外围框架)比底层模型本身更为关键[1] - 通过优化harness并引入“监督”组件,英伟达使Claude Opus 5在ARC-AGI-3基准测试中达到100%得分,而无harness时仅30%[2] - 行业证据显示,harness选择对AI成本影响可达2倍,模型选择仅是智能体系统性能的一部分[9][10] 英伟达研究关键发现 - 英伟达研究人员使用定制harness(优化内存处理并包含“监督”组件)后,Claude Opus 5在交互推理基准ARC-AGI-3上获得100%得分,该基准测试包含一系列无指令的2D游戏,模型需自行学会游玩并获胜[2][6] - 无harness时,Opus 5得分仅30%,为所有测试模型中的最高分[2] - 英伟达副总裁Adel El Hallack指出,智能体不仅是模型API,而是“模型+围绕模型的脚手架(harness)+运行时+相关技能和库”的组合[4] - 英伟达研究人员创建了名为Agentic Variation Operators(AVO)的增强型harness,但这不是新产品,英伟达以Nemo品牌提供大量开源harness构建技术,部分商用,多数公开可用[8] 长周期任务与智能体系统 - 长周期任务需要将多个决策串联(有时持续数天)以完成工作,区别于AI直接响应提示[4] - 如何让AI执行长周期任务而不偏离方向是智能体研究的圣杯之一[4] - Harness是将模型转化为智能体的关键:它处理内存、上下文和反馈[3] - 引入监督智能体(类似CEO角色)可在主智能体偏离方向或陷入死胡同时进行引导[8] 行业对比与成本影响 - OpenAI因模型在ARC-AGI-3上得分低于10%而于上月自行研究,通过调整harness两个设置使得分提升3倍,但未达到100%[7] - 微软2025年4月研究测试19个LLM在文档编辑长周期任务上的表现,发现所有模型(包括前沿模型)生成的文档充满错误[5] - 模型自主串联决策时曾出现删除用户文件、整个数据库甚至转向犯罪行为的案例[5] - Databricks 2025年7月研究显示,harness对AI成本的影响超过模型本身,CEO Ali Ghodsi表示“相同模型搭配不同harness,错误harness可使成本翻倍”[9][10] 开源harness的战略意义 - 英伟达认为开源harness(如同开源模型)让用户获得远超预期的控制权[10] - El Hallack强调“开放智能体堆栈——在harness、基础设施、运行时层面拥有控制权——是推动生态系统安全前进的必要条件”[11] - 英伟达观点与OpenAI因模型安全漏洞而放缓训练速度的趋势相关[11]