面向特定动作的未来潜变量提升自动驾驶安全性

面向特定动作的未来潜变量提升自动驾驶安全性

Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng +3 更多

1 分钟阅读2026年8月20日

DA-WAM 为每条候选轨迹分别预测未来,然后根据每个具体动作可能带来的后果,对各个选项进行评分。在 NAVSIM-v1 消融实验中,这种决策对齐设计将 PDMS 从不进行未来预测的规划器的 93.31 提升至结合安全导向反事实监督后的 93.68,并改善了碰撞、合规性、碰撞时间和舒适度等指标。

目录

研究人员构建了什么?

DA-WAM 是一种驾驶世界模型,旨在帮助自动驾驶车辆从多条可能轨迹中做出选择。传统规划器可能根据当前场景考察多条候选路径,或者让所有候选路径共享一个对未来场景的预测。DA-WAM 则为每个候选动作分别预测不同的未来潜变量状态。

潜变量状态是对场景的紧凑内部表示,而不是直接渲染出的视频帧。例如,一个潜变量可以表示车辆继续直行时会发生什么,另一个则刻画左转可能带来的后果。随后,轨迹评分器利用专门针对该候选路径预测的未来,对每条候选轨迹进行评估。

系统由三个部分组成。首先,预训练视频表征模型从当前观测中提取场景特征。其次,动作条件预测模块为每条候选轨迹估计未来潜变量。最后,评分器结合预测的未来和驾驶目标,对候选项进行排序。

训练过程还会让未来预测与规划保持关联。DA-WAM 不会在预训练后冻结预测表征,而是在轨迹评分器学习的同时调整其中选定的部分。系统还加入安全关键样本,用于学习区分几何形状相近、但最终结果截然不同的路径。

DA-WAM 动作条件驾驶世界模型概览

取得了哪些关键结果?

DA-WAM 在包含 12,146 个驾驶场景的 NAVSIM-v1 navtest 划分上进行了评估。主要指标预测驾驶员模型得分(Predictive Driver Model Score,PDMS)综合了五项驾驶目标:避免无责碰撞、保持在可行驶区域内、持续前进、维持碰撞时间以及乘坐舒适度。此外,研究还使用可行驶方向合规性(Drivable Direction Compliance)作为诊断指标。

消融结果表明,仅仅增加一条潜变量路径并不能解决规划问题。不进行未来预测的规划器获得了 93.31 的 PDMS,而当前潜变量控制方案为 93.25。共享全局未来的方案表现更差,仅为 92.81,因为单一预测无法表示不同动作各自带来的后果。

采用面向特定动作的预测后,PDMS 提升至 93.46;加入反事实安全监督后,得分进一步升至 93.68。这比无未来预测基线高 0.37 分,比共享全局未来的控制方案高 0.87 分。

规划器配置PDMS报告的 EP解读
无未来预测93.3191.36强大的传统基线
当前潜变量控制93.25未报告仅增加额外路径,收益很小
共享全局未来92.8188.68单一未来造成预测与动作不匹配
动作条件未来93.4690.47每个候选项都有自己的未来
动作条件未来 + 困难负样本93.6889.97更安全地辨别候选项,但前进程度下降

定性对比也呈现出相同趋势。在大幅左转时,DA-WAM 更贴近专家路径;在交通密集和让行冲突场景中,它也避免了对比系统遭遇的碰撞或碰撞时间惩罚。

用于区分安全与不安全驾驶未来的反事实轨迹监督

DA-WAM 如何工作?

DA-WAM 从当前观测开始,将其转换为空间场景标记。这些标记是紧凑的特征向量,用于表示驾驶场景中的位置和视觉信息。预训练的 V-JEPA 2.1 主干网络提供初始表征,而低秩适配(Low-Rank Adaptation,LoRA)则在选定的 Transformer 层中加入少量可训练参数。

规划器沿用现有的基于候选项的规划流程生成候选轨迹。每条候选轨迹都会经过一条动作条件预测路径。该路径估计车辆遵循这条特定轨迹时应当出现的未来潜变量状态。评分器同时接收候选轨迹及其对应的未来潜变量,从而保持动作与预测后果之间的一一对应关系。

这一点至关重要。如果所有候选项共享同一个未来表征,评分器看到的将是场景的平均描述。这种表征可以捕捉整体交通环境,却会丢失区分两条近乎相同路径的细节——例如,一条路径会穿过另一辆车的预测位置,而另一条则始终保持畅通。

未来预测采用在线—目标双分支架构。在线编码器处理当前观测,并通过规划损失和预测损失进行更新。目标编码器在训练时处理观测到的未来帧。目标编码器的参数由在线编码器通过指数移动平均逐步更新,且目标分支不传递梯度。这样可以构造稳定的预测目标,并帮助避免表征坍缩为缺乏信息的特征。

目标分支只在训练阶段使用。部署时,经适配的在线编码器生成潜变量特征,评分器则对候选未来进行排序。安全关键困难负样本会加入候选项几何形状相近、但预测结果不同的示例,迫使评分器关注后果,而不只是路径形状。

不同驾驶规划方法在摄像头视角和鸟瞰视角下的得分对比

DA-WAM 对机器人技术为何重要?

其核心启示不局限于自动驾驶汽车:当预测直接服务于正在做出的决策时,预测模型才会更有用。对于移动机器人而言,仅仅预测“环境将变成什么样”还不够。预测必须回答:“如果机器人采取这条具体路线、以这个速度或执行这个机动动作,将会发生什么?”

这一原则可以帮助仓储机器人在多条巷道路线之间做选择,帮助配送机器人绕行行人,也可以帮助工业系统在靠近人类工人的区域选择运动方式。当前地图上看似最短的路线,可能在其他智能体移动后变得不安全。面向候选项的未来预测,让决策层能够在执行前比较这些后果。

这种方法还提供了一种实用的模型适配策略。在训练 LoRA 模块的同时冻结预训练视觉主干网络的大部分参数,可以减少需要更新的参数数量。这对于需要在算力受限的车载硬件上部署感知与规划模型的团队具有现实意义,不过现有结果没有报告运行时间或内存占用。

正在评估仓储机器人二手工业机器人的机构,可以将 DA-WAM 视为一种更安全的自主系统设计范式:生成多个可行动作,预测每个动作对应的结果,再根据这些结果对动作进行评分。

有哪些局限与待解决问题?

报告中的评估主要集中于 NAVSIM 仿真场景,因此这些结果并不能证明系统在真实道路、异常天气、传感器故障或人类出乎意料的行为下的表现。现有材料也只给出了消融得分,而没有对所有竞争性驾驶系统进行完整的数值比较。

安全性的提升伴随着权衡:加入困难负样本监督后,PDMS 和若干安全相关指标有所提高,但自车前进程度(Ego Progress)从 90.47 降至 89.97。这说明评分器变得更加谨慎,并非所有驾驶目标都得到全面改善。

该设置还包含 NAVSIM-v2 更广泛的 EPDMS 指标评估,但现有材料没有说明相应结果。计算成本、推理延迟、摄像头分辨率、候选项数量,以及分布偏移下的性能,仍是部署时需要重点考察的问题。

常见问题

DA-WAM 解决了什么问题? DA-WAM 通过为每个动作分别预测未来,帮助驾驶规划器区分候选轨迹,而不是使用一个共享的场景未来预测。

什么是未来潜变量状态? 它是对预测未来场景的一种紧凑学习表征。该表征能够捕捉与决策相关的后果,而不必生成完整的未来视频。

为什么共享未来预测效果较差? 共享未来会混合多个动作带来的后果,使系统更难判断哪条候选路径会导致碰撞、驶离车道或交通冲突。

DA-WAM 是否能改善每一项驾驶指标? 不能。最强配置改善了 PDMS、碰撞相关指标、可行驶区域合规性、碰撞时间和舒适度,但其报告的自车前进程度得分更低。

结论是什么?

DA-WAM 将每个候选驾驶动作与其专属的未来预测连接起来,让评分器能够直接判断每个选择可能造成的结果。NAVSIM 消融实验表明,这种面向特定动作的连接在安全导向困难负样本的强化下,能够提升整体规划质量,同时也清晰展现出安全性与前进程度之间的权衡。

未来预测式评分是否应成为自主移动机器人规划器的标准配置?

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策