文章核心观点 - 表征是人工智能理解、推理与预测世界的底层语言,其学习质量直接决定下游任务的能力上限,是理解AI技术演进与路线分歧的主线 [2][10][11] - AI表征的演进经历了从符号AI、特征工程、深度学习到基础模型四个阶段,底层线索是机器记录与组织世界方式的变化,当前正走向跨任务、跨模态的统一表征空间 [2][24][25] - 当前基础模型时代存在四组核心表征路线分歧:表征中心与生成中心、符号表征与分布式表征、离散表征与连续表征、显式世界模型与隐式潜空间 [2][40][41] - 表征研究仍面临核心争议,包括表征是否等于理解、表征坍缩、可辨识性、好表征判据以及多模态统一表征能否成立等开放问题 [2][3][54] - 在物理AI(如自动驾驶与机器人)落地场景中,表征的具体形式(如离散/连续动作、数据来源、架构选择)成为技术路线分化的核心,智能驾驶作为最先跑通闭环的场景值得重点关注 [3][66][67] - 数字AI底座模型发展路径已较清晰,但其难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,在当前发展阶段增量潜力更大 [3] 表征:人工智能理解世界的底层语言 - 表征指AI系统将图像、文本、声音等外部信息转化为机器可计算内部编码的过程,通常以向量形式存在,是AI完成识别、生成、推理或控制的基础 [10][11] - 分布式表征思想由Hinton等人在1986年提出,强调由多个单元共同表示一个对象,为新对象的泛化提供了基础 [11] - 表征质量直接决定模型能力边界,机器学习算法的成功很大程度上取决于数据的表示方式 [2][11] 表征三层含义:数据编码、模型特征与意义问题 - 数据层面:关注如何将原始输入(如图像像素、文本token)编码为机器可计算的形式(如向量),编码方式直接影响下游任务性能上限 [13][14][16] - 模型层面:关注神经网络中间层(隐藏层激活、潜空间)学到了什么内部特征,涉及表征的可解释性与可控性问题 [13][14][19] - 哲学层面:探讨模型内部向量是否真正“承载”了真实含义,涉及“理解”的本质,与中文房间、随机鹦鹉等思想实验相关 [13][14][21] 表征演进:从人工符号到统一基础模型 - 符号AI时代(1956-1990s):依赖人工设计的离散符号和逻辑规则构建可解释表征,但难以处理模糊性与不确定性 [25][27][28] - 特征工程时代(1990s-2012):依赖专家设计特征(如SIFT、HOG、TF-IDF)结合浅层学习,迁移性和扩展性不足 [25][31][32] - 深度学习时代(2012-2020):以AlexNet(2012)和Transformer(2017)为关键节点,神经网络能够端到端自动学习连续表征 [25][34][35] - 基础模型时代(2020-今):以GPT-3、CLIP等为代表,通过自监督与大规模预训练形成跨任务、跨模态的统一表征空间,但可解释性、幻觉与对齐问题被放大 [25][37][38] 表征路线分歧:生成、符号、离散与世界模型 - 表征中心 vs 生成中心:前者(如CLIP、MAE)显式优化可迁移表征;后者(如GPT、扩散模型)主张表征在生成数据任务中涌现 [42][43][44][45] - 符号表征 vs 分布式表征:符号路线强调清晰符号与逻辑规则以支持组合推理;连接主义路线强调知识分布在网络参数中;神经符号路线尝试结合两者 [46][47] - 离散表征 vs 连续表征:离散路线(如VQ-VAE)将信号映射为有限token集合,便于复用语言模型框架;连续路线(如隐扩散模型)在连续潜空间中表示和编辑,信息损失较低 [48][49] - 显式世界模型 vs 隐式潜空间:在物理AI中,显式路线主张生成可观察的未来状态(如画面)辅助决策;隐式路线主张在潜空间中预测关键状态,更节省算力 [50][51] 核心争议:理解、坍缩与统一表征仍待验证 - 表征是否等于理解:中文房间、符号接地、随机鹦鹉等观点质疑模型基于统计共现的表征是否等于真正理解 [3][21][56] - 表征坍缩问题:指模型将不同输入映射为高度相似的表示,需通过引入不对称约束等方法避免 [57][58] - 表征的可辨识性:不同训练过程是否会收敛到相似表征,柏拉图表征假说提供证据表明不同模型表征可能趋同 [3][60] - 什么是“好表征”:尚无统一定义,可能判据包括任务准确率高、可解释可迁移、与因果结构一致、能够解缠关键因素等 [61][62] - 多模态统一表征是否可能:CLIP实现了图文对齐,ImageBind进一步将六种模态绑定到同一空间,但仍面临模态特征损失与模态鸿沟问题 [63][64] 物理AI落地:自动驾驶与机器人的表征分歧 - 自动驾驶的四类分歧: - 一段式与两段式架构:一段式(端到端)感知决策一体,信息链路短但可解释性差;两段式先感知再规划,更易排查 [68][69] - 纯端到端与VLA路线:VLA在视觉与动作间引入语言或语义中间表征以提升可解释性,2025年理想、小鹏、元戎启行等多家车企转向此路线 [69] - 世界模型部署:分歧在于用于云端生成数据评测(如特斯拉、商汤)还是参与车端实时决策(如蔚来NWM) [69] - 显式生成与隐式潜空间:量产侧显式生成更常见(特斯拉、华为、蔚来等),隐式路线更多见于学术与机器人场景 [69][70] - 机器人的核心分歧: - 动作表征:离散动作token(如RT-2)便于复用语言模型范式;连续动作(如π0)更适合高自由度、高精度控制 [73][74] - 数据来源:分歧在于依赖人类操作视频预训练、真机遥操作数据或仿真与多源数据,多源混合成为趋势 [74] - 系统架构:单体VLA试图一模型贯穿所有;快慢双系统将场景理解与高频控制拆分(如Figure Helix、英伟达GR00T N1) [74][75] - 世界模型形式:隐式潜空间(如Meta V-JEPA 2)与显式生成(如1X、DeepMind Genie 2)路线并存 [75] - 自动驾驶与机器人的共性与差异: - 共性:均需对物理世界进行编码,并围绕动作形式、中间表征、系统架构、世界模型用途等产生路线分化 [77][78] - 差异:数据来源(自动驾驶有真实里程数据,机器人数据稀缺)、实时性与动作维度要求、世界模型定位(自动驾驶偏数据生成评测,机器人偏通用学习底座)不同 [78] 结论:表征革命是AI范式演进的主线 - 表征方式的变革是历次AI范式迁移的底层线索,当前新一轮表征范式仍处于验证阶段 [79][80] - 后续五大观察方向:统一世界表征能否成形、离散与连续路线如何收敛、显式与隐式世界模型谁主导物理AI、可解释与可控表征能否实用化、因果表征与真实世界数据结合 [80][81][82] - 表征问题不会过时,如何更好地表征世界是判断AI技术路线和产业格局的重要抓手 [82]
【AI系列深度04期】什么是表征?
东吴汽车黄细里团队·2026-07-29 22:21