原力灵机DM0.5
搜索文档
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
猿大侠· 2026-08-26 12:11
核心观点 - 原力灵机开发的DM0.5模型在具身智能评测RoboDojo中登顶,展现了强大的记忆能力和泛化性,并已全面开源,旨在推动行业生态发展[1][8][105] RoboDojo评测表现 - RoboDojo由香港大学、加州大学伯克利分校、清华大学等全球近20所顶尖学术机构发起,难度极高[4] - 截至2026年7月,仿真榜单头部模型平均成功率仅8.80%,真机榜单仅12.8%[5] - DM0.5在RoboDojo综合得分24.90,平均成功率19.34%[8] - DM0.5在Memory维度得分47.74,显著领先第二名GalaxeaVLA的8.61分[11][12] - DM0.5在Cover Blocks任务中三次随机考试均取得100%成功率[9] 其他权威评测成绩 - LIBERO综合成功率99.0%[14] - RoboTwin 2.0简单场景成功率93.6%,复杂场景成功率93.3%[14] - VLA-Arena不同难度成功率分别为89.0%、53.6%、44.1%[14] - RoboChallenge Table30 v2综合得分54.42,成功率43%[14] 核心能力与Demo展示 人类示教与记忆能力 - DM0.5支持最长60秒的原生长记忆能力,能深度记住并连贯审视自身动作序列[27] - 基于长记忆,模型可直接理解人类演示的视频片段,实现一次示教即复制[20][28] - 该能力解决物理世界长尾任务泛化性不足的问题,引入Human-in-the-Loop[24] 精细操作能力 - 6台机器人耗时15小时,用81920块微型积木拼出长3.5米的长城模型[32] - 积木拼装精度在0.1到1毫米尺度内,超越人手约0.3到1毫米的自然抖动极限[35] - 机器人具备自动纠错能力,能通过先对准再抖动下压的“寸劲儿”完成扣合[38][40] - 削黄瓜demo中,模型能实时闭环调整刀深和力道,适应柔性物体形态变化[43] 长程稳定高节拍 - 在物流分拣场景中,DM0.5不依赖预设脚本,纯靠实时视觉识别和决策[53] - 平均3秒一单,准确率超过99%[53] 抗干扰能力 - DM0.5采用分层双系统架构,即System1与System2[60] - Sys2负责理解、拒绝与大局预判,Sys1负责长程复杂任务中的琐碎细节[61] - 外部视点剧烈变化时,通用Picking鲁棒性依然极强[62] - 人类强行打断任务,机器人能准确理解当前状态并自适应修正后续动作[64] 技术实现核心变量 数据 - 真机数据:5万小时高精度操作,覆盖100+种丰富动作[77] - Ego数据:10万小时场景视频,支持毫米级高精度3D Landmark生成[77] - 仿真数据:100万平空间数据建模复杂室内环境[76] - 采用omni融合思路解决数据量问题,注重质量而非单纯硬采[79][80] 架构三大创新 - 原生长记忆:在上下文抽象层做大量工作,通过高效信息压缩技术,让4B参数的VLM在预训练阶段就能原生学习并记住历史信息[83][84] - 具身思维链:设计11项推理任务驱动模型,对指令、本体、环境进行三方联合建模[88] - 构造“反事实任务”,故意给出错误指令,迫使模型真正“看懂”而非机械匹配[89] - 对齐式动作监督:利用约束动态规划高效计算最优匹配,一次性解决动作轨迹不一致问题[91] 推理效率优化 - 模型核心延迟从534.04毫秒降至57.49毫秒,累计加速9.29倍,延迟降低89.2%[100] - API延迟p50为67.75毫秒,p90为70.01毫秒[100] - LIBERO成功率从98.45%降至98.40%,精度基本无损[100] - 优化包括Vision TRT静态图+FP8、Tuned FlexAttention、Triton fused小核等[101] 开源与生态 - DM0.5已全面开源,包括模型权重、训练框架、下游任务工作流[105][106] - 开源地址:GitHub (https://github.com/dexmal/opendm)、Hugging Face (https://huggingface.co/Dexmal/DM05)、Tech Blog (https://www.dexmal.com/blog/dm0)[113] - 开源旨在推动具身智能行业更透明的讨论、更真实的评测和更多公开的工作[112] - 公司认为物理AI早期不成熟,需要像Transformer开源推动ChatGPT一样,让方法论可被复用[112]