CogDrive: Cognition-Driven Multimodal Prediction-Planning Fusion for Safe Autonomy
摘要
Safe autonomous driving in mixed traffic requires a unified understanding of multimodal interactions and dynamic planning under uncertainty. Existing learning-based methods often fail to capture rare but safety-critical behaviors, while rule-based systems lack adaptability in complex interactions. To address these limitations, we propose CogDrive, a cognition-driven multimodal prediction–planning fusion framework that integrates explicit modal reasoning with safety-aware decision optimization.
技术细节
Transformer, MLP Encoder, Cross-Attention Decoder
论文解读
CogDrive深度解读:认知驱动的多模态预测-规划融合框架
一、研究动机与核心问题
自动驾驶在混合交通环境中面临的核心挑战是:如何在与不可控的人类驾驶 agent 交互时,同时实现行为预测的适应性和规划决策的安全性。
现有方法存在两大局限:
学习方法的长尾问题:数据驱动模型在常见场景表现良好,但对罕见但安全关键的交互行为(如突然变道、紧急制动)学习不足,导致预测失效。
规则方法的适应性不足:基于规则的系统虽然安全可解释,但在复杂多变的交互场景中缺乏灵活性,难以处理多模态不确定性。
CogDrive 的核心创新在于引入认知驱动的理念:不仅从数据中学习运动模式,还从认知结构中学习 agent 如何解释和响应不确定性,从而在适应性和安全性之间取得平衡。
二、框架总体架构
CogDrive 框架遵循"认知驱动自主"原则,其中认知机制桥接感知、推理和控制。它实现人-车-环境交互的精确建模和数字化表示,支持可解释且准确的轨迹预测和安全稳定的规划决策。
2.1 多 agent 联合轨迹预测
在复杂交通中,每个 agent 的未来运动不仅取决于自身历史,还受周围参与者行为影响。给定观测轨迹,预测模块生成 K 个多模态轨迹假设,每个假设对应一种交互模式及其概率。
多模态预测分布
其中 ,该概率公式捕捉多模态不确定性,支持对罕见但安全关键行为的推理。
2.2 自车辆安全稳定轨迹规划
基于多模态预测 ,规划器生成可行且安全的自车轨迹 ,确保短期碰撞避免和长期行为稳定性。规划器采用多模态准备策略:不仅跟踪最可能模式,还在所有预测模式下保证安全。
三、多模态联合轨迹预测
预测模块将多模态联合轨迹预测公式化为认知驱动的学习过程,实现交互 agent 间运动意图的可解释和准确推理。
3.1 认知行为模态建模
为表示 agent 间多样且可控的交互模式,CogDrive 引入受拓扑运动等价启发的认知行为模态表示。传统单点距离度量难以捕捉交互的拓扑结构差异,而拓扑表示通过累积相对角位移量化两个 agent 间的相对角位移。
拓扑交互特征
其中 为相对角位移, 为距离权重,该特征捕捉交互的拓扑结构而非单纯几何距离。
基于拓扑特征,CogDrive 对交互模式进行分类,将连续轨迹空间离散为 K 个认知上可区分的模式。每个模式对应一种交互策略(如让行、超车、并行),使网络能够显式学习稀疏但安全关键的行为。
3.2 场景表示与相对特征编码
场景输入包括 agent 历史和地图信息。CogDrive 采用向量化表示:agent 轨迹表示为位移向量序列,车道表示为中心线向量。为消除全局坐标影响,所有特征转换到以目标 agent 为中心的局部坐标系。
最近邻关系编码:对每个 agent,识别其最近邻 agent 并编码相对运动特征,包括相对距离、速度差、航向差等。这些特征显式捕捉交互强度,使网络聚焦于最关键的社会交互。
3.3 向量化嵌入与对称上下文编码
异构输入(agent 状态、车道中心线)通过独立 MLP 映射到统一隐空间。编码后的特征通过对称上下文编码器处理,该编码器基于 Transformer 架构,通过自注意力机制捕捉全局上下文依赖。
3.4 可学习解码
解码阶段,一组可学习查询向量通过多头自注意力和交叉注意力与编码上下文交互。每个查询对应一种潜在行为模式,自注意力确保查询嵌入的多样性防止模式坍缩,交叉注意力使每个查询与编码特征图交互。
解码过程
其中 包含 个可学习查询,每个代表一种潜在交互模式。经过 层解码后,输出投影为轨迹坐标 和模式概率向量 。
3.5 网络训练
CogDrive 在Winner-Takes-All (WTA) 策略下训练,联合优化轨迹回归、分类和模态一致性。总训练目标结合三个互补损失:
总损失函数
其中 。WTA 方案选择具有最小最终位移误差的预测模式 ,通过反向传播更新对应的模式概率和轨迹。
模态分类损失:采用最大间隔损失确保不同模式的可分性,间隔 防止模式概率坍缩。
回归损失:通过位置和航向角监督细化轨迹精度和运动平滑性,航向损失捕捉预测和真实航向间的角度一致性。
模态正则化:引入可微分代理近似离散模态匹配函数,实现模态一致性的端到端优化。
四、多模态安全感知轨迹规划
基于预测模块生成的 K 个概率轨迹假设,CogDrive 执行安全感知的应急轨迹树规划,确保在多模态不确定性下的短期碰撞避免和长期行为稳定性。
4.1 多模态准备规划
与不确定 agent 交互时,自车必须在所有可能运动模式下保持安全。CogDrive 采用基于准备的规划策略:显式考虑预测行为分布,不仅跟踪最可能模式,还生成短期应急轨迹保证所有模式下的安全。
多模态应急规划问题
其中 和 分别为自车状态和控制输入, 为离散时间车辆动力学, 定义安全和舒适约束。代价函数惩罚对所有预测模式的偏差,确保鲁棒性。
4.2 单车辆轨迹规划
在多模态准备策略基础上,CogDrive 进一步公式化几何和优化基础的单车辆轨迹规划器,通过统一优化过程桥接认知驱动预测和低层控制,强制动态可行性、空间安全和时间平滑。
多模态预测初始化:规划器接收 K 个多模态轨迹假设,构建加权标称轨迹并生成候选轨迹集,作为后续优化的自适应初始猜测。
动态几何约束生成:由于周围车辆不可控,CogDrive 通过动态更新的几何约束建模其与自车的交互。每辆车由前后圆形包络近似,通过中心位移向量构建分离超平面,强制自车与邻近车辆间的最小分离距离。
静态与鲁棒走廊约束:为考虑环境边界和多模态预测的不确定性,CogDrive 在静态障碍物和车道边界周围构建鲁棒安全走廊。每个走廊表示为凸多面体,根据预测位置不确定性自适应扩展。
二次规划公式化:整合动态和静态约束,自车轨迹优化公式化为约束二次规划问题,通过高效优化求解器实时求解。
执行与重规划:优化收敛后,仅执行规划轨迹的第一段,其余作为预测参考。每个重规划周期整合新的多模态预测和环境测量,以前一轨迹为热启动重新初始化优化,确保多模态不确定性下的实时适应性和稳定闭环行为。
五、实验与结果分析
5.1 实验设置
数据集:CogDrive 在两个大规模真实世界基准上评估:Argoverse 2 和 INTERACTION。两个数据集都包含详细轨迹和高精地图,支持运动预测和多 agent 推理的细粒度评估。
INTERACTION 数据集提供使用无人机和路侧传感器在中国、德国和美国采集的自然多 agent 驾驶数据,覆盖交叉路口、环形交叉路口和合流场景。
Argoverse 2 包含来自6个城市的多样化驾驶数据,提供丰富的场景变化和交通密度。
评估指标:采用标准运动预测基准指标,包括最小联合平均位移误差(minJointADE)、最小联合最终位移误差(minJointFDE)、遗漏率(MR)等。
5.2 INTERACTION 数据集结果
| 方法 | minJointFDE (m)↓ | minJointADE (m)↓ |
|---|---|---|
| AutoBot (Girgis et al. 2021) | 1.015 | 0.312 |
| THOMAS (Gilles et al. 2021) | 0.968 | 0.416 |
| Traji-MAE (Chen et al. 2023) | 0.966 | 0.307 |
| HDGT (Jia et al. 2023) | 0.958 | 0.303 |
| FJMP (Rowe et al. 2023) | 0.922 | 0.275 |
| CogDrive (ours) | 0.914 | 0.301 |
CogDrive 在 INTERACTION 数据集上取得最佳 minJointFDE=0.914m 和强 minJointADE=0.301m,超越 FJMP 和 HDGT 等基线。与 Traj-MAE 和 HDGT 等学习模型相比,CogDrive 在密集多 agent 场景中展现更高一致性,表明其捕捉复杂社会交互和避免长尾误预测的更强能力。
改进源于其认知驱动的多模态推理,显式建模交互模式的拓扑结构,使网络能够区分认知上可区分的交互策略,而非仅依赖几何距离。
5.3 Argoverse 2 数据集结果
| 方法 | b-minFDE (m)↓ | minFDE (m)↓ | MR↓ | minADE (m)↓ |
|---|---|---|---|---|
| LaneGCN (Liang et al. 2020) | 2.054 | 1.362 | 0.162 | 0.870 |
| mmTransformer (Liu et al. 2021) | 2.033 | 1.338 | 0.154 | 0.844 |
| DenseTNT (Gu et al. 2021) | 1.976 | 1.282 | 0.126 | 0.882 |
| TPCN (Ye et al. 2021) | 1.929 | 1.244 | 0.133 | 0.815 |
| SceneTransformer (Ngiam et al. 2021) | 1.887 | 1.232 | 0.126 | 0.803 |
| CogDrive (ours) | 1.833 | 1.209 | 0.120 | 0.803 |
在 Argoverse 2 上,CogDrive 取得最低遗漏率 MR=0.120,表明最高安全一致性,同时取得最佳位移精度(minFDE=1.209m)和竞争性 minADE=0.803m。
与 DenseTNT 和 SceneTransformer 相比,CogDrive 在长时域轨迹上产生更低误差,反映多模态不确定性下增强的时间稳定性和鲁棒性。这些改进受益于统一的预测-规划耦合,多模态预测直接指导规划器的安全约束生成。
5.4 定性分析
与纯运动学模型不同,认知驱动框架同时捕捉合作和竞争交互,适应时间上下文并防止不合理转换。这些结果说明 CogDrive 在异构交通环境和多样驾驶文化中的泛化能力,实现可解释和安全一致的多模态推理。
5.5 交互决策案例研究
为评估 CogDrive 的决策能力,使用自然驾驶数据在 MIND 框架中进行闭环仿真。仿真中周围 agent 遵循其记录轨迹,自车基于 CogDrive 执行在线预测和规划。
该案例展示 CogDrive 在真实交互场景中的自适应安全控制能力:通过多模态预测显式考虑不确定性,通过准备规划保证安全,通过认知推理实现可解释决策。
六、核心贡献与创新点
1. 认知驱动的多模态预测:首次将认知行为模态表示引入自动驾驶轨迹预测,通过拓扑运动语义和可微分模态损失,显式学习稀疏但安全关键的交互行为,解决长尾问题。
2. 统一预测-规划融合:提出预测和规划的端到端耦合框架,多模态预测直接指导规划器的安全约束生成,规划结果反馈优化预测模型,实现认知一致性。
3. 多模态准备规划策略:基于应急响应概念,在所有预测模式下保证安全,而非仅跟踪最可能模式,显著提升混合交通中的鲁棒性。
4. SOTA 性能:在 Argoverse 2 和 INTERACTION 两个基准上取得领先结果,特别是在遗漏率和长时域预测精度方面,证明框架的有效性和泛化能力。
七、局限性与未来方向
计算复杂度:多模态预测和准备规划增加计算开销,实时性优化是部署关键。
极端场景泛化:在训练数据未覆盖的极端场景(如事故、违规)中,认知模型的泛化能力需进一步验证。
多传感器融合:当前框架主要基于轨迹数据,未来可整合视觉、激光雷达等原始传感器输入,实现端到端感知-预测-规划。
人机交互:在有人驾驶和无人驾驶混合场景中,如何建模人类驾驶员的认知过程和意图,是提升交互自然性的关键方向。
引用信息
@article{huang2024cogdrive,
title={CogDrive: Cognition-Driven Multimodal Prediction-Planning Fusion for Safe Autonomy},
author={Huang, Heye and Yang, Yibin and Fan, Mingfeng and Wang, Haoran and Zhao, Xiaocong and Wang, Jianqiang},
journal={arXiv preprint arXiv:2512.02777},
year={2024}
}
本报告仅供学术交流和研究参考使用。