智能AI
morning
DiDrive:自动驾驶中安全离线强化学习的风险感知分层扩散框架
摘要
arXiv:2609.01609v1 Announce Type: new Abstract: While diffusion models effectively capture multimodal behavioral priors for autonomous driving, offline reinforcement learning (RL) policies remain susc...
and
the
distribution
high
diffusion
for
autonomous
driving
offline
risk
2026-09-03
1 阅读
约1分钟阅读
Qisong Guo, Jingtang Chen, Zhilin Chen, Pei Xu, Mingjian Fu, Wenxi Liu, Yuanlong Yu
字号:
arXiv:2609.01609v1 公告类型:新 摘要:虽然扩散模型有效地捕获自动驾驶的多模式行为先验,但离线强化学习(RL)策略仍然容易受到分布转移、重尾风险信号、分布外(OOD)动作生成和高维状态冗余的影响。为了应对这些挑战,我们提出了 DiDrive,一种分布式引导的离线扩散框架,具有两个协同组件:风险感知分层扩散 (RHDif) 架构和 3DICE 策略优化范例。在状态空间中,RHDif 利用低级风险门控编码器和高级上下文调制器来过滤环境冗余并专注于安全关键威胁。在动作空间中,3DICE 通过样本内校准指导、时空优化和基于集合的候选排序来减轻 OOD 高估和梯度振荡。 CARLA基准评估表明,DiDrive相对于IQL、CQL和Diffusion-QL等基准的优越性,特别是在60辆车的复杂、高密度交通场景中,取得了85%的成功率和4295.68的平均奖励,为安全自动驾驶决策提供了稳健的途径。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱