核心观点 - 理想汽车Foundation Model团队发布ME-Dex 1.0论文,提出将触觉信号纳入World Action Model,使机器人同时预测未来视频、未来触觉和动作,以解决纯视觉无法感知物理接触的局限[2][6][12] 技术路线与创新 触觉进入世界模型的必要性 - 机器人仅靠视觉无法理解物理世界中的接触信息,如握持力度、接触点位置等关键状态[1][9] - 精细操作、插拔、装配、双手协同等任务依赖触觉,视觉在这些场景下不稳定[10] - 触觉不应仅作为当前输入条件,而应与视频一样成为未来世界状态预测的一部分[12][15][17] 三大技术门槛 - 数据层:现有数据集如RoboTwin、DexJoCo缺乏触觉信号,ManiFeel等触觉数据集规模小且格式不统一[22][23][24] - 表示层:不同机器人触觉传感器的位置、数量、形状、分辨率各异,需统一映射到共同空间[25][26][27][28][29] - 模型层:需解决视觉、触觉、动作的联合建模,使模型同时预测未来视频、未来触觉和动作[30][31][32][33] 统一触觉表示方案 - 建立Canonical Hand Model,定义统一手部区域模板,将不同机器人触觉传感器映射到对应区域[41][42] - 区分"无传感器"与"有传感器但无接触"两种状态,避免模型误解[43][44] - 训练Unified Tactile Autoencoder,将不同来源触觉力场压缩为统一latent表示[44][45][46] 三专家架构设计 - Video Expert负责未来视频预测,Tactile Expert负责未来触觉latent预测,Action Expert负责输出action chunk[50] - 三个expert均使用flow matching训练[51] - 采用H-Bridge shared attention,视频、触觉、动作三个模态在中间层交换信息,浅层和深层保留独立处理[52][53][54][55] 数据生成策略 - 使用Agentic Tactile Data Engine,在RoboTwin和DexJoCo等已有数据上通过仿真replay动作轨迹,从仿真力传感器记录触觉信号[58][59] - RoboTwin联合训练50个任务,包含27,500条Clean和Random轨迹[59] - DexJoCo覆盖11个任务,包括单臂和双臂任务[59] 实验结果 RoboTwin评测 - ME-Dex 1.0在Clean和Random评测中分别达到91.56%和91.92%成功率[64] - 相比Fast-WAM的89.22%/89.22%,分别提升2.34和2.70个百分点[65] - 相比Fast-WAM+Tac的90.22%/90.22%,也有进一步提升[66] - 消融实验显示:仅视频和动作的VA版本Random为86.90%,加入当前触觉条件提升至89.54%,加入未来触觉预测提升至90.60%,完整模型加H-Bridge达到91.92%[68][69][70][71] - 当前触觉输入置零时,Clean和Random仍达91.70%和91.74%,说明触觉监督在训练阶段塑造了模型表示[74][75][77] DexJoCo评测 - ME-Dex 1.0在11个任务上平均成功率达65.3%,高于DECO的56.4%和DECO.p的57.8%[80] - 五个双手任务bimanual average为48.8%,而DECO和DECO.p均为39.6%[81] - 在Assembly、Microwave等接触密集任务上表现较强[81] ManiFeel评测 - ME-Dex 1.0平均成功率为70.0%,比ManiFeel baseline的55.0%提升15个百分点[84] - Power Plug Insertion从58.0%提升到88.0%[84] 行业意义 - 理想汽车首次公开具身大脑研究,表明汽车公司做具身并非简单复用自动驾驶视觉经验,而是处理机器人独有的物理交互问题[94] - 具身智能将进入处理复杂接触问题的新阶段[95][96][97]
理想具身大脑首次公开,ME-Dex 1.0让触觉真正放进世界模型本身