在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境
机器之心·2026-09-15 12:36

核心观点 - 文章提出一种新的AI能力提升路径:不继续扩展模型参数(Scale Model),而是通过让智能体自主探索新环境、积累经验来扩展经验(Scale Experience)[4] - Aether AI提出的RSIAgent框架,通过递归自我提升(RSI)机制,使Agent在不更新模型参数的情况下,通过自主探索、试错、验证,将稳定的动作-条件-结果因果关系沉淀进Memory,实现能力持续提升[6] - 实验表明,RSIAgent能使开源模型在OSWorld 2.0和Agents' Last Exam上超越GPT-6 Astra等前沿闭源模型,验证了“Scaling Experience”路线的有效性[8] RSIAgent框架与机制 - RSIAgent核心是将Agent与新环境的交互过程本身变成持续学习过程,系统围绕不断演化的Memory,构建由curriculum agent、actor agent和verifier agent组成的多智能体递归闭环[15] - curriculum agent决定下一步探索什么,actor agent进入环境执行任务并积累经验,verifier agent根据真实环境反馈判断结果可靠性,最终将有效知识持续写入Memory[15] - 采用Broad-to-Deep两阶段自探索策略,类似于大模型训练中的Pre-training到Post-training[15] - 第一阶段Broad Recursive Self-exploration:类似Pre-training,curriculum agent每轮同时生成多个方向不同的探索任务,由多组actor agent和verifier agent并行执行与验证,快速建立对环境的广泛认知,形成“环境知识地图”[16][17] - 第二阶段Deep Recursive Self-exploration:类似Post-training,curriculum agent首先生成困难任务,让系统进入可能出现异常、隐藏约束或边界情况的场景,根据暴露出的失败和未知问题继续设计更难任务,形成顺序递归链:困难任务→执行→验证→更新Memory→更困难任务[18] - 两阶段探索得到的Memory会被冻结,直接用于后续任务执行,使Agent在不更新模型参数的情况下获得可复用的新环境能力[18] 实验表现与数据 - 在OSWorld 2.0(0808 offline)上,RSIAgent取得78.98%的Partial Score,大幅领先GPT-6 Astra的72.60%和Claude Opus 5的70.19%[23][24] - 在Agents' Last Exam(Near-term)上,RSIAgent达到84.82%的Partial Score,超过GPT-6 Astra的82.26%和Claude Opus 5的79.54%[23][24] - RSIAgent基于GLM-5.3与Kimi-K3开源模型,在OSWorld 2.0上从71.97%提升到78.98%,在Agents' Last Exam上从83.75%提升到84.82%[23][24] - 在GameCraft-Bench自主游戏开发任务中,RSIAgent在Mechanics、Depth、Visuals、Art和Overall Quality上均带来提升,以Codex+GPT-5.5为Generator时,Overall从52.77提升至61.28[25][26] - 消融实验验证了Broad和Deep两阶段的重要性,移除任何一方均会大幅影响探索的广度或深度[27] - 随着RSI轮次增加,Agent表现持续提升,不同任务呈现不同收敛速度,简单任务快速达到高分,复杂任务需要更多轮探索,最终得分可达到100%[29] 技术路线与行业意义 - Aether AI的因果驱动智能体路线关注核心问题:AI能否不只从历史数据中学习相关性,而是在与环境持续交互过程中,主动识别真正影响结果的变量、理解行动与结果之间的因果结构[32] - 团队围绕因果分析、环境探索、长期记忆到长程决策展开系列研究:Causal-Copilot探索自主因果分析,C-World构建开放式工具使用环境,Auto-scaling Continuous Memory与Hybrid Self-Evolving Structured Memory研究经验沉淀为长期记忆,StructAgent统一因果结构组织状态、执行与验证[33][34] - RSIAgent推动Agent从被动训练走向主动因果发现与学习,通过持续交互、试探和验证,逐步发现动作、条件与结果之间的因果关系[36] - 不同难度任务呈现不同“进化速度”:简单任务经过少量RSI轮次快速收敛,复杂任务需要更多轮主动探索,实验中初始成功率仅为0–40%的任务,随着RSI轮次增加最终可提升至100%[37] - 未来Agent能力上限不仅取决于底层模型有多强,更取决于能否通过主动干预环境,持续完成因果发现、因果验证与因果知识积累,并将这些规律转化为长期可复用的能力[37]

在多项高难度Benchmark超越GPT-6 Astra,RSIAgent让开源模型自主探索新环境 - Reportify