3D Intelligence
搜索文档
明明看懂了,为什么一碰到物体还会硬推到底?和多位大佬一起聊了聊触觉、数据和部署
具身智能之心· 2026-08-26 12:08
文章核心观点 机器人进入真实世界需补上三类能力:理解不可见状态(如触觉反馈)、根据实时反馈修正动作、将部署后的失败数据用于持续学习 通用能力更可能从专用场景中逐步积累而来 机器人感知与表征的局限性 - 机器人任务失败原因之一是许多关键状态(如阻力、卡住)在视觉画面中不可见,机器人无法感知这些反馈 [2][4] - 机器人需要形成3D Intelligence,理解空间和物理关系,而非仅仅依赖显式3D表征模块 [17][19] - 时间维度同样重要,机器人需理解物体动态特性(如重量、摩擦)以推断接触后的变化 [20] - 视觉提供整体场景,但接触发生后的关键信息(如阻力)不会明显写入画面,需结合触觉和力觉 [22] 触觉与力觉的实时修正作用 - 机器人一次生成连续动作的策略存在盲区:若书已卡住,原动作继续执行,即使感到阻力也可能来不及修改 [27][28] - 视觉适合判断整体方向,触觉和力觉应承担高频修正,上层模型决定大致做法,下层根据接触偏差及时修改动作 [28] - 具身模型需在动作执行期间保持清醒,根据世界变化判断原动作是否适用 [31] - 触觉反馈到来后,快策略可将原本生成的动作逐步拉回更合适的方向 [33] 传感器大规模部署的工程挑战 - 传感器能否进入Scaling,取决于量产级的稳定性和易用性,而非仅原理有效或Demo惊艳 [40] - 团队数据采集峰值曾涉及1000余名数采人员,分布在全国四五十座城市 [37] - 设备分发到真实场景后,充电、连接、标定和误操作都会成为数据生产链上的新问题 [37] - 团队曾为精确记录夹爪开合增加编码器,但规模放大后编码器损坏、充电、蓝牙不稳定等问题导致数据无法使用,最终回归更简单的视觉标记方案 [38][39][40] 人类数据与机器人数据的互补关系 - 人类数据可提供规模和场景广度,但能否进入训练取决于动作信息是否可靠及与机器人本体的对齐 [45] - 人手与二指夹爪结构不同,人类手腕轨迹不一定能直接映射为机械臂动作 [45] - 人类数据和机器人数据不是二选一:人类数据告诉模型真实世界可能出现什么,机器人数据负责将经验落到具体身体和控制方式上 [46] - 数据规模上升后噪声也会放大,采集质量不同会导致最终策略表现明显拉开 [47][48] 部署后的持续学习与数据闭环 - 真实部署中长尾问题(如书以新角度卡住、材质变化)难以提前收集完整 [51] - 在线自进化当前最大难题是整套基础设施:稳定推理、持续发现失败、接入人工纠正、重新部署 [52] - 失败数据不应被直接丢掉,它真实记录了动作如何改变世界,可用于训练世界模型、价值模型或奖励模型 [54][55] - 成功示范告诉机器人应该怎样做,失败数据第一次告诉它自己究竟不会什么 [56] - 从离线示范到在线纠正的训练闭环仍需人工参与,距离完全自主进化还有很长距离 [58] 力觉加入模型的时机与策略 - 力觉与机械臂、末端执行器、传感器安装方式和控制频率紧密相关,换一台机器人或夹爪,力信号含义可能变化 [60][61] - 视觉和语言数据可跨平台积累,力觉数据难以统一,若从预训练阶段就覆盖所有平台,采集成本高且数据难统一 [60][62] - 即使拥有纯视觉预训练模型,后续再加入触觉或力觉进行后训练仍可取得效果 [63] - 先通过视觉和人类数据让机器人学会识别环境、理解任务和生成基本动作,再针对具体身体和场景补上力觉适配 [64] - 后训练阶段增加力觉通路,让策略学会根据接触反馈修改动作,而不必推倒基础模型 [67] 通用能力的积累路径 - 早期仍会有一批明确场景先产生收入,客户首先关心机器人能否稳定完成任务 [68][69] - 专用场景先落地不等于每个项目都重新定制,硬件平台、软件框架、算法范式应能不断复用 [71] - 通用能力不只体现在机器人能做多少种任务,还体现在能力能否迁移到更多物体和场景,进入新项目是否需从零采数据和重新训练 [72] - 真正的通用能力会在一个个专用场景里遇到问题、产生数据、修正模型,再逐渐沉淀到共同平台中 [74]