Workflow
未来操作视频
icon
搜索文档
最新Challenge来了!具身世界模型如何从预测未来走向因果选择?
具身智能之心· 2026-08-26 12:08
文章核心观点 - 具身世界模型的核心价值在于能否在机器人执行动作前“预演”未来,从而减少试错并找到正确行动路径,而非仅仅生成逼真的视频画面 [2][4] - 斯坦福大学、牛津大学、中山大学、X-Era AI团队联合发起的ActPhysCause Challenge旨在评测具身世界模型是否真正理解机器人动作、物理过程与任务目标,重点奖励“做得对”而非“画得像” [5][9] Track 0:未来视频生成赛道 - 参赛模型接收机器人操作场景的初始观测(一张640×480首帧)和自然语言指令,在生成过程中不再访问模拟器,直接预测机器人执行任务后的未来视频 [13][16] - 比赛不限定模型范式,通用视频生成模型、机器人世界模型及结合VLM、VLA或Physical AI先验的系统均可参与 [16] - 当前ECCV版本仅对Track 0计分,奖金池暂定为USD 2,000,第一名USD 1,000、第二名USD 700、第三名USD 300 [19][42] - 参赛者需为500个测试样本生成未来操作视频,每支队伍每天最多提交一次 [42] 评测指标:RCS-100评分体系 - RCS-100评分同时考察生成质量与任务忠实度,从两个视角整合为一个单一分数(0-100) [9][14] - 质量维度(A,免参考)包含6项指标:视觉清晰度、背景稳定性、运动平滑度、物理合理性(穿透/漂浮/瞬移等违反率)、空间一致性、指令遵循度 [14] - 保真度维度(B,与真值对比)包含5项指标:逐帧外观一致性、夹爪轨迹一致性、操作物体轨迹一致性、结果匹配度、高级语义一致性 [14] - 反直觉的基线实验显示,Static Anchor(重复首帧121次)取得最高PSNR(15.2 dB)和LPIPS(0.277),但Instruction Grounding与Outcome Match均为0;而Same-task Retrieval Anchor的PSNR仅11.9 dB,但Instruction Grounding达到2.46/4 [24] 核心评测能力:从视觉生成到具身任务理解 - 评测关注的不是单一“观感”,而是模型是否同时理解指令、动作、物体、物理过程与任务结果 [18] - 模型需具备三层能力:动作与指令(选对物体、机械臂和动作顺序)、物理与时序(接触、碰撞、支撑是否连续合理)、过程与结果(关键中间状态可信,最终状态满足指令) [25] - 视频只是可观察的载体,真正被评测的是模型对“动作—状态变化—任务结果”关系的理解 [21] 基线实验关键发现 - 画面更像不代表任务更对,像素接近不能替代任务判断 [24] - 在统一未使用RoboTwin数据微调的零样本设置下,基于Cosmos Nano的PC-Phys在Instruction Grounding上达到2.60/4,高于多数普通零样本视频生成模型 [28] - 通用视频数据让模型生成连贯画面,而贴近Physical AI与embodied interaction的数据才能帮助模型学习“动作如何改变世界” [28] - BG-Lock利用固定相机先验减少背景漂移和闪烁,说明面向机器人场景的结构先验同样重要 [28] 长期路线:从预测走向因果选择 - 当前ECCV版本仅Track 0计分,Track 1–3为后续公开路线 [40] - Track 1(Video-Action Joint Generation):联合生成未来动作与未来视频 [45] - Track 2(Action Correction):给定失败动作历史,修正动作并预测更合理的未来 [45] - Track 3(Causal Action Selection):从多个候选动作中选出最可能导致目标结果的动作 [45] - 最终目标是实现闭环控制:策略提出候选动作→世界模型预演不同后果→系统比较成功概率与风险→选择最可能成功的动作→执行后获得新观测进入下一轮预测-决策-执行 [33][34][35][36][37][38] 参与方式与资源 - 比赛官网:https://actphyscause-challenge.x-era.com/ [8] - 实时榜单:https://actphyscause-challenge.x-era.com/leaderboard.html [8] - 数据集:https://huggingface.co/datasets/X-EraAI/ActPhysCause_Challenge_Track0/tree/main [8] - 代码:https://github.com/X-EraAI/ActPhysCause-Challenge [8] - LoViF 2026 @ ECCV Workshop将于2026年9月8–9日在瑞典马尔默举行 [43]