汽车行业点评报告:AI系列深度06期:Transformer如何从序列任务走向基座模型?
东吴证券·2026-07-30 08:24

行业投资评级 - 增持(维持) [1] 报告核心观点 - 报告认为,Transformer架构凭借其并行训练和规模化能力,已成为云端通用基础模型(如GPT、BERT及后续的LLM、VLM、VLA)的核心底座,主导了人工智能2017年后的加速演进 [4][7][8] - 报告指出,数字AI底座模型发展路径已逐渐清晰,但其难以实现物理世界的建模闭环,而物理AI将成为物理世界的AI解决方案,在AI当前发展阶段成为增量更大的方向,其中智能驾驶作为最先跑通闭环的代表场景应重点关注 [4] - 报告认为,尽管Transformer替代了传统RNN主干,但循环思想并未消失,以状态空间模型(如Mamba)、RWKV和线性注意力为代表的新循环路线,在长上下文、端侧低功耗和低时延场景中体现价值,成为特定约束下的重要补充 [4][25][30] - 报告强调,从RNN到Transformer的演进,本质上是记忆方式与计算方式的再平衡,两者在记忆、计算和长程建模上存在三组关键分歧 [4][26][27] 序列建模的共同问题与核心难点 - 序列建模面向文字、语音、视频、车辆轨迹等有顺序的数据,其核心难点在于处理数据的变长、有序和长程依赖特性,模型需保留上下文并将相距较远的相关信息联系起来 [4][9][10] - 序列数据的顺序本身携带信息,且存在长程依赖这一核心难点,即决定当前输出的关键信息可能出现在很久以前 [11] - 序列模型需在长程记忆、训练并行和推理成本之间进行权衡 [11] RNN机制与固有约束 - RNN的基本思路是把历史压缩进一个随时间更新的隐藏状态,通过循环、隐状态与时间展开的机制处理序列,其推理成本相对恒定 [4][13][14] - LSTM和GRU通过门控机制缓解长程遗忘问题,Seq2Seq框架和注意力机制进一步推动了RNN的应用扩展 [4][17] - RNN的固有约束在于必须逐步串行处理,难以充分利用并行算力,且长距离信息容易在压缩状态中衰减 [4][18] Transformer机制与规模化能力 - Transformer采用自注意力机制,让每个位置直接与序列中所有位置交互,通过QKV(查询、键、值) 向量实现全局检索,显著缩短了长程依赖路径 [4][20][22] - Transformer的核心设计包括多头注意力、位置编码和前馈层,辅以残差连接与层归一化以稳定训练 [23] - Transformer的核心优势是并行训练和规模化能力,使其能够承接更大规模的数据与算力,推动规模法则成为大模型时代的重要规律 [7][24] - Transformer的计算代价在于,注意力计算量随序列长度平方增长,且生成阶段的KV缓存会带来显存和带宽压力,这是其在超长上下文和端侧部署中的重要瓶颈 [24] 技术路线分歧与新循环回潮 - RNN与Transformer的分歧可归纳为三组关键权衡:记忆方式(定长状态 vs 全量缓存)、计算特性(训练串行/推理成本恒定 vs 训练并行/推理成本随长度增加)和长程建模(信息易衰减 vs 路径短但计算成本高) [4][26][27] - 线性注意力通过改写注意力形式将平方复杂度降为线性,在数学上建立了注意力与循环之间的联系 [28] - 状态空间模型(如Mamba)RWKV代表了新循环路线的重要方向,前者训练计算量随长度线性增长且推理无需KV缓存,后者尝试结合Transformer的训练并行性与RNN的推理效率 [4][28] - 混合架构是当前更具落地性的折中路径,例如在多数层使用高效结构(如线性注意力、Mamba层)以降低成本,在少数层保留全注意力以维持精确回忆能力 [4][29] 产业应用与前景 - 在产业层面,通用大模型仍以Transformer为默认底座;而在物理AI、端侧和车端等功耗和时延约束更强的部署环境中,更可能较早采用循环类、状态空间或混合架构 [30] - 智能驾驶作为物理AI中最先跑通闭环的代表场景,报告认为应重点关注 [4]

汽车行业点评报告:AI系列深度06期:Transformer如何从序列任务走向基座模型? - Reportify