面向规划的端到端自动驾驶:架构、指标与安全

面向规划的端到端自动驾驶:架构、指标与安全

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li +5 更多

2 分钟阅读2026年8月21日

综述协议

我们采用结构化叙述性综述协议,覆盖已形成体系的 E2E-AD 研究,以及快速涌现于同行评审期刊会议、arXiv 预印本、基准测试代码库、挑战赛排行榜、代码发布和官方项目页面中的最新工作。主要资料来源包括 IEEE Xplore、ACM Digital Library、SpringerLink、ScienceDirect/Elsevier、arXiv、OpenReview、CVF Open Access、NeurIPS 论文集、公开基准测试代码库和官方项目网站。

主要检索时间范围为 2015 年至 2026 年 6 月;对于奠定神经网络驾驶或端到端驾驶基础的更早研究,也一并纳入。核心检索词包括“端到端自动驾驶”“基于学习的规划”“闭环驾驶”“自动驾驶规划基准”“nuPlan”“NAVSIM”“Bench2Drive”“WOD-E2E”“世界模型自动驾驶”“视觉语言驾驶”“VLA 驾驶”“自动驾驶长尾问题”和“自动驾驶泛化基准”。

我们还以高关联度论文和基准为起点开展了前向与后向引文追踪,包括 PilotNet、Conditional Imitation Learning、Learning by Cheating、TransFuser、TCP、UniAD、VAD、NAVSIM、Bench2Drive、DriveLM、SimLingo、WOD-E2E 和 LEAD。

纳入与排除标准

满足以下至少一项标准的工作将被纳入:

  1. 提出具有影响力的 E2E 驾驶范式。
  2. 预测与规划直接相关的输出,例如控制量、航点、轨迹、轨迹分布或动作 token。
  3. 提出用于规划评估的基准、数据集、仿真器或指标。
  4. 提出与自车规划相关的世界模型、VLM 或 VLA 机制。
  5. 发布公开数据集、基准、代码库、评测服务器或可复现性资源。
  6. 对 E2E 驾驶提出安全性、可解释性、鲁棒性或评估方面的分析与批评。

我们排除了仅关注感知、检测、分割、跟踪或运动预测的研究,除非其直接服务于自车规划,或已被广泛用于 E2E 驾驶系统。对于技术细节不足以进行比较的纯专有系统,也不予纳入。

对于每项保留的工作,我们在可获得的情况下记录其输入表示、规划输出、监督信号、评估协议、基准证据以及公开资源情况。

范围与定义

当一个自动驾驶系统将驾驶输入映射为驾驶输出,并且这一映射作为学习策略或可微系统进行优化,最终目标是生成驾驶动作、带路线条件的轨迹或运动计划时,可以将其称为端到端系统。

输入可以包括摄像头图像、LiDAR、雷达、自车状态、高精地图、路线指令、目标点或自然语言。输出可以包括转向和油门、航点、轨迹、轨迹分布或离散动作 token。

面向规划的 E2E-AD 演进

E2E-AD 的演进并非沿着单一架构谱系展开,而是从模仿低层控制,逐步转向学习更易检查和基准化的表示、监督信号与评估协议,从而形成规划行为。

端到端自动驾驶历史时间线

从神经控制到条件模仿

端到端驾驶的根源早于现代深度学习。ALVINN 展示了神经网络可以将道路图像映射为转向指令;随后,一些越野驾驶系统也在受限条件下证明了直接学习感知到动作映射的可行性。DeepDriving 引入了驾驶可供性预测,作为手工设计的感知模块与直接控制之间的中间表示。此后,PilotNet 通过证明卷积网络能够从人类示范中学习,并在真实道路场景中控制车辆,成为摄像头到转向学习的现代参考基线。

控制、航点与轨迹

输出形式的选择也会影响评估方式。轨迹可以通过位移误差、碰撞代理指标、路线进度、碰撞时间、舒适性或偏好标签进行评分。在开环日志中,直接控制指令更难比较,因为同一个控制量在不同车辆状态和控制器动力学下可能产生完全不同的后果。随着基准测试日益以规划为中心,轨迹输出已成为 E2E 研究的主流接口。

监督目标与部署后行为之间还存在一个常被忽视的不匹配。日志中的轨迹并非普适最优解,而是某位人类驾驶员在特定交互历史下做出的一个具体选择。模型一旦发生轻微偏离,日志中记录的后续轨迹可能就不再可行,甚至不再值得执行。

因此,单纯的逐点 L2 轨迹损失可能会误导模型。它鼓励模型模仿某一条固定未来,却没有教会策略在受到扰动后如何从多个安全替代方案中进行选择。现代规划器正越来越多地加入多模态预测头、轨迹细化、规则感知代价或学习式评分函数,以弥合这一差距。

总体而言,从直接控制转向轨迹输出并不只是输出格式的变化;它让策略可以借助控制器、安全约束和规划指标进行更清晰的检查,同时也带来了关于多模态未来与规划选择的新问题。

BEV、占用与矢量化场景表示

BEV 表示之所以流行,是因为它为规划提供了具备几何意义的坐标系。它可以将多视角摄像头、地图、车道、目标和占用信息整合到统一的空间网格中。ST-P3、UniAD 及相关工作使用类似 BEV 的结构,同时支持检测、预测、占用和规划损失。

矢量化表示则更进一步:它不再使用稠密网格,而是将车道、智能体和轨迹表示为结构化 token。VAD 证明了矢量化场景表示能够支持高效自动驾驶;VADv2 则通过概率规划延续了这一方向。

面向规划的自动驾驶系统结构表示

BEV 与矢量空间的规划优势在于可解释性和对约束的兼容性。与原始图像特征相比,规划器在空间表示中更容易推理可行驶区域、车道拓扑、智能体交互和路线进度。

其风险在于,稠密 BEV 处理可能计算开销较大,而且可能继承用于监督它的感知标注的局限。包括 DriveTransformer 和 DrivoR 在内的近期稀疏化、基于寄存器的设计,可以理解为在保留规划相关结构的同时降低计算成本的尝试。

总体而言,BEV、占用和矢量表示的价值并不只是提升感知能力;它们在规划层面的核心价值,是将原始传感信息转换为能够与地图、智能体、自由空间和路线约束进行核验的几何结构。

统一系统与任务耦合

任务耦合也会带来新的风险。如果统一模型表现良好,人们可能难以判断究竟是哪一个内部组件发挥了作用;如果模型失败,调试也可能比模块化系统更加困难。此外,联合训练可能导致捷径学习:模型过度依赖自车状态或路线信号,却没有充分利用视觉证据。

因此,面向规划的架构必须配合因果诊断、消融实验和能够暴露捷径行为的基准协议。

由此反复出现的架构问题,并不只是究竟应该选择模块化还是端到端,而是哪些接口必须保持稳定,以满足安全、调试和评估的需要。

系统可以在端到端训练的同时保留显式接口,例如占用、车道拓扑、目标 token、路线指令、不确定性估计或候选轨迹。反过来,一个看似模块化的系统也可能将下游损失持续传回上游表示。

纵观近期系统,一个共同趋势是:暴露规划和安全检查所需的变量,同时减少由人工设计目标对学习策略形成的主导。

不确定性与生成式规划

尚待解决的问题是如何评估生成式规划结果。只有当一个分布能够将安全且符合目标的轨迹排在不安全或无关轨迹之上时,它才真正有用。因此,基于世界模型的评估、偏好标签和闭环仿真,都是生成式规划的自然补充。

面向闭环行为的架构启示

这些观察为架构论文提出了一份实用检查清单。作者应报告:

  • 规划器是否使用显式路线 token 或目标点。
  • 除横向路径外,是否还预测速度。
  • 控制器是学习得到的还是固定的。
  • 轨迹样本是否通过学习式代价进行排序。
  • 当自车状态偏离日志轨迹时,策略是否能够恢复。

缺少这些细节时,架构比较往往变成对隐藏评测机制的比较。

总体而言,如果不报告规划接口、控制器、安全封装层和恢复机制,架构创新就很难得到准确解读。这些细节对闭环行为的影响,往往不亚于编码器骨干网络。

训练信号与数据引擎

在仿真环境中,学习者与专家之间的不匹配尤其重要。特权专家可以低成本地产生大规模数据,但如果专家使用了学生无法观测的真实状态,那么生成的示范就可能难以被基于摄像头的学生可靠模仿。

LEAD 通过设计专家和导航条件,缩小教师与学生在可见性、不确定性和意图方面的差异,从而重新审视了这一问题。这一思路的重要之处在于,它将专家设计视为学习问题的一部分,而不是把专家当作固定不变的数据源。

指标体系

开环指标包括平均位移误差、最终位移误差、轨迹 L2 误差,以及根据日志场景计算的碰撞代理指标。它们适合快速迭代,但不足以作为最终证据。

模型可能能够匹配日志轨迹,却无法在偏离后恢复;而另一条轨迹可能比人类记录的路径更安全或更自然。“Is Ego Status All You Need?” 一文表明,开环协议可能容易受到捷径的影响:模型过度依赖自车状态信号,而不是感知信息。Hidden Biases 同样证明,基准协议可能扭曲人们对 E2E 驾驶模型的结论。

开环与闭环为何会产生分歧

开环与闭环指标出现分歧,是由结构性原因造成的。首先,开环评估在专家的状态分布下对策略进行评分,而闭环评估则在策略自身诱导出的状态分布下进行评分。

其次,开环指标往往会惩罚合理的替代方案,尤其是在多模态交互场景中。再次,开环指标通常缺少来自背景智能体和规则违规情况的反馈。最后,闭环系统依赖控制器细节、仿真器动力学和随机场景结果,而这些因素可能不会出现在开环日志中。

这一分歧对综述写作具有实际影响。除非明确评估协议,否则不应将某种方法称为 state of the art。出色的 nuScenes L2 分数、出色的 NAVSIM PDMS 分数和出色的 Bench2Drive Driving Score,代表的是不同类型的结论。

当比较表按照基准和指标体系对方法分组,而不是将不同协议下的分数混在一起时,其可信度会更高。

近期的相关性研究进一步凸显了这一点。对 NAVSIM 与 Bench2Drive 结果进行交叉比较表明,具备安全意识的开环分数,与闭环驾驶分数的相关性可能高于 ADE 或 FDE;但排名倒置仍然存在,部分子指标也可能出现饱和。

NAVSIM 风格的分数具有价值,因为它们可扩展,且比 L2 更关注规划;但应将其表述为代理证据,而不是闭环交互的替代品。相反,Bench2Drive 风格的分数在行为层面更有意义,但仍受 CARLA 仿真器分布的限制。

因此,稳健的实证结论至少应同时参考一种真实日志代理协议和一种具备反应性的闭环协议。

推荐报告协议

对于未来的 E2E-AD 论文,我们建议报告五组证据:

  1. 开环轨迹质量。
  2. 非反应式真实日志规划分数。
  3. 闭环路线与违规指标。
  4. 长尾场景或偏好感知性能。
  5. 定性失败分析。

作者还应报告传感器配置、路线输入、输出类型、控制器、安全封装层、训练数据来源、数据筛选方式、计算预算、随机种子、基准版本和指标实现。

缺少这些细节时,排行榜上的微小差异很难解释。

我们建议避免设置单一的“最佳方法”列。更诚实的格式,是分别列出开环模仿、规划代理指标、反应式闭环、长尾分布偏移、代码可用性和计算成本。

某种方法即使开环 L2 较弱,却可能在闭环路线完成度上表现出色,因此是更好的规划器。某种方法即使在 NAVSIM 上表现强劲,却在 Bench2Drive 中运行缓慢,也可能是在牺牲行进效率的前提下过度优化安全性。某种 VLA 方法即使能够生成出色的解释,其轨迹表现却平平,也不应被包装成自动驾驶领域的突破。

比较的基本单位应当是具体主张,而不是模型名称。

运行时保障与安全包络

基准测试中的经验安全性,并不等同于运行安全保障。实际的 E2E 驾驶系统很可能需要运行时机制,对学习式规划器进行约束或监控。

这些机制并不要求放弃端到端学习:神经策略负责提出轨迹,而保障层则检查该方案是否仍处于经过验证或受规则约束的安全包络之内。

这一观点与面向规划的 E2E-AD 相容,因为它将学习模块视为候选行为的来源,而不是车上唯一的安全机制。

目前有几条相关工程路径:

  • 安全监视器可以拒绝违反可行驶区域、限速、路线拓扑或碰撞时间阈值的规划。
  • 当置信度较低时,备用规划器可以切换到保守制动或基于规则的车道保持。
  • 基于规则的安全屏障可以强制执行交通灯、停车标志或车道边界约束。
  • 控制屏障函数和可达性分析可以为低层控制定义安全集,但要将其扩展到由感知驱动、涉及多智能体且维度很高的 E2E 策略,仍然十分困难。
  • 紧急制动模块可以降低碰撞风险,但可能造成舒适性受损

常见问题

什么样的自动驾驶系统才算端到端? 它通过经过驾驶目标优化的学习策略或可微系统,将驾驶输入映射为动作、带路线条件的轨迹或运动计划。

为什么轨迹输出在 E2E 驾驶研究中越来越常见? 与直接控制指令相比,轨迹更容易通过控制器、安全约束和规划指标进行检查。

为什么开环与闭环指标可能不一致? 开环评估使用专家的状态分布,而闭环评估使用策略自身诱导出的状态,并纳入控制器、仿真器和交互效应。

未来的 E2E-AD 论文应报告哪些内容? 论文应报告开环、规划代理指标、闭环、长尾或偏好感知性能,以及定性失败证据,同时说明传感器、控制器、数据、计算资源和指标细节。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策