TransDiffuser: 理想VLA diffusion出轨迹的架构

文章核心观点 - 文章详细解释了Diffusion模型在自动驾驶轨迹生成中的应用，特别是理想汽车VLA（Vision-Language-Action）系统的技术架构和创新点 [1][4][6] - 理想汽车的VLA系统通过Diffusion模型生成驾驶轨迹，相比VLM（Vision-Language-Model）系统具有更强的拟人感和决策能力 [1][2][4] - TransDiffuser模型通过多模态感知信息融合和去相关优化机制，显著提升了轨迹生成的多样性和质量 [6][11][12] 什么是Diffusion - Diffusion是一种通过加噪和去噪过程学习数据分布的生成模型，核心思想类似于逆向拼图 [4] - 相比GAN和VAE等其他生成模型，Diffusion在生成质量和稳定性上具有优势 [4] - 理想汽车采用ODE采样器将Diffusion生成步骤从几十步减少到2-3步，大幅提升效率 [5] 理想VLA系统的技术特点 - VLA是一个具备快慢思考能力的单一系统，直接输出action token并通过Diffusion解码为轨迹 [4] - 系统能同时生成自车轨迹和预测其他交通参与者轨迹，提升复杂环境博弈能力 [5] - 当前系统输出轨迹而非直接控制信号，但未来可能演进到直接输出油门/方向盘信号 [3] TransDiffuser架构细节 - 模型采用编码器-解码器结构，融合图像/LiDAR/运动状态等多模态信息 [6][7] - 场景编码器处理前视图像（8视角）和LiDAR数据（5传感器），输出BEV/图像/点云特征 [7][10] - 去噪解码器基于DDPM算法，通过10步迭代生成覆盖4秒的8个waypoints轨迹 [9][11] - 在NAVSIM数据集上PDMS指标达到94.85，优于Hydra-MDP++等现有方法 [11] 关键创新点 - 无锚点轨迹生成：不依赖预设轨迹或词汇表，直接从感知数据生成轨迹 [11] - 多模态去相关优化：解决模式崩溃问题，提升轨迹多样性且计算开销低 [11][12] - 采用256批量大小分布在4个NVIDIA H20 GPU上进行训练 [10] 局限性与未来方向 - 模型微调存在困难，特别是感知编码器部分 [13] - 未来可能结合强化学习，并参考OpenVLA等先进模型架构 [13] - 直接输出控制信号（油门/方向盘）是更难的挑战，短期内难以实现 [3]