核心观点 - GPT-6 Astra的发布标志着AGI加速到来,其强大的基础通用模型能力在具身智能领域引发巨大浪潮,但基模能力的突破仅是起点,系统级能力构建才是长期竞争力的关键 [1][9][52] - 穹彻智能发布的RoboRSI框架,通过多智能体自进化机制,解决了基模在具身智能中持续执行、诊断、修订和复用的系统级难题,为具身智能公司提供了不可替代的价值 [10][11][53] GPT-6 Astra对具身智能的冲击 - GPT-6 Astra在机器人控制任务中成功率达到95%,远高于Fable 5.1的40%,输出Token用量仅为后者的约1/6.2,成本约为后者的1/2.3 [3] - 用GPT-6基模控制机器人执行复杂操作的案例迅速增多,行业出现“GPT-6横扫具身”的趋势,具身智能可能成为通用模型的一个子领域 [3][9] - 知名具身智能企业创始人指出,当前具身智能没有真正护城河,通用模型公司在人才、算力和资金上占优,未来一两年是关键窗口 [9] - Robocurve预测,如果趋势持续,大语言模型最早在2024年底、最晚在2029年实现对机械臂的实时控制 [9] - 基模在真实环境中存在安全问题,RoboDojo团队评测显示,Astra在真机测试中反复发出物理上不合理或不安全的动作,部分事故造成硬件损坏,团队提前停止测试,未能完成原定18项任务的RoboDojo-Real评测 [9] 具身智能面临的核心系统难题 - 执行过程中的异常处理难题:机器人报错停止、抓取失败、位置偏移后,需要结果检查、异常恢复和安全决策,过去全靠工程师手动跟进,大模型无法负责现场恢复 [15] - 历史经验沉淀复用难题:每次让Agent参考完整执行记录会导致Token消耗持续增长,每次局部失败就重写整套流程则系统难以收敛 [15] - Context管理成为新时代的代码管理:机器人系统核心挑战从写出正确控制代码,转变为管理Agent持续运行产生的海量上下文(轨迹、日志、视频、代码版本、失败记录) [15] 穹彻智能RoboRSI框架设计 - 设计哲学:给人和Agent各自提供合适的接口,对人提供高层引导,对Agent提供清晰结构 [16][17][18] - 对人:无需深入底层实现,专注于目标设定、专业判断和安全边界,将日常执行交给多智能体 [17] - 对Agent:通过层级化技能树,明确修改范围、成功标准和失败反馈路径,让局部修订始终围绕全局目标展开 [18] - 采用Manager、Planner、Engineer、Reviewer四类智能体协作架构,将规划、执行、诊断和修订拆分到不同上下文中 [22] - Manager作为调度中枢,负责任务队列管理、并发worker调度、断点恢复和技能版本管理,将高层目标分解为可执行任务序列 [31] - Planner根据环境观察和技能库生成具体执行计划 [31] - Engineer调用底层工具执行动作并生成候选能力 [31] - Reviewer复盘执行结果,定位失败原因,将修订建议返回Manager推动下一轮迭代 [31] - 四个角色围绕同一任务和执行证据接力运行,形成“执行→诊断→修订→再执行”闭环,人类保留对目标、价值判断和安全边界的控制权 [25] - 工程师角色从逐行编写任务代码、跟进底层执行,转向设定目标、审核结果和提供方向性指导 [26] TSR技能树机制 - 提出TSR(Top-down Skill Refinement,自顶向下技能细化)机制,用四层技能树组织机器人全部能力 [28] - 任务族:定义总体目标与约束,如“家庭地面清理” [32] - 复合技能:组合多步能力,如“搜索目标→移动→抓取→放置” [32] - 原子任务:边界明确、结果可验证的最小任务单元,如“抓取地面上的黄色包装袋” [32] - 基础技能:与机器人直接交互的底层能力,包括视觉感知、移动控制、抓取、放置等 [32] - 技能树为Coding Agent提供结构性约束,每次修改限制在清晰技能边界内,Agent专注局部实现但不会偏离全局目标 [28] - 历史经验从对话记录和日志,变成下一轮真正可调用的能力 [29] 三阶段演进机制 - 从成功的调用链中提取稳定结构,将物体类别、目标区域和空间关系参数化,将可复用流程固化为代码技能 [33] - 类似任务再次出现时,Agent只需选择、监控和必要时修订整条技能,重复工具调用步骤由代码承担 [33] - 在LIBERO基准测试中,启用代码固化相比未启用版本,回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%,中位VLM调用次数下降27.2%,中位执行时间下降17.0% [36] - Agent的推理资源只留给真正变化和不确定的部分 [37] 实验验证结果 - 零样本任务适配:经过约一天并行执行,LIBERO基准累计任务通过率从32/120提升到95/120,RoboTwin从初始的9/50提升至36/50 [39] - 完整多智能体配置(Planner+Engineer+Reviewer)在RoboTwin上将通过率提升4倍,相比仅使用Engineer单角色的基线 [39] - 代码固化效果:在LIBERO的120个任务、5组初始布局、共600个episode实验中,回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%,中位VLM调用次数下降27.2%,中位执行时间下降17.0% [40] - 扰动鲁棒性:在LIBERO-Plus的840个扰动实例中(涵盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度),RoboRSI通过自适应修订将通过率从31.1%提升至47.4%,额外恢复137个原本失败的实例 [42] 商业价值与场景适配 - 2024年完成类似家庭地面清理Demo需两名工程师连续投入约一个月,编写约2,000至3,000行任务代码,RoboRSI框架下一天内走完完整闭环 [45] - 新场景适配成本被大幅压缩,核心成本从“工程师驻场数周”变为“设定目标+系统自主迭代+人工审核和安全把关” [46] - 为家庭等高度个性化场景打开新商业空间:每个家庭户型、家具布局和物品摆放不同,若每次部署需工程师驻场数周则服务成本难以支撑大规模推广 [47] - RoboRSI在通用能力基础上,通过现场反馈自主迭代,逐步学会适合家庭的清理路径和操作技能,家具移动、物品更换后也可沿用同一套机制完成适配 [47] - 类似需求存在于布局各异的门店、办公室和小型仓储空间,缩短适配周期意味着过去因定制成本过高而难以覆盖的分散场景都有机会成为可服务的市场 [47] 具身智能公司的未来方向 - 仅在语义基座上做微调改造得到的具身模型,容易遭遇GPT-6的降维冲击 [50] - 基模解决了“理解”问题,但从理解到持续稳定执行,中间还有系统级能力需要构建,这是具身智能公司不可替代的价值 [52] - 具身智能公司下一阶段机会,是把不断增长的模型能力变成用户在真实世界中用得起来、用得长久的机器人能力 [53] - 穹彻智能将探索RoboRSI和Noe-0世界动作模型协同,突破机器人能力边界、走向真实应用 [53] - 三个关键系统能力:经验的结构化管理与复用、行为边界与安全约束、部署后的持续迭代能力 [54]
用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单
机器之心·2026-09-22 14:16