智能AI
morning
时隔十年,AI大牛署名新论文
摘要
时隔十年,AI大牛署名新论文 杰西卡 2026-09-24 20:58:55 来源: 量子位 杰西卡 发自 ROBO-人 量子位ROBO | 公众号 AI4ROBO 自动驾驶领域再出一篇原创研究论文。 这篇最新论文,让自动驾驶能“走一步想十步”,更像老司机了! 最近,任少卿指导发布论文 《MM-Future: Multi-Mode Joint World–Action Modeling for A...
Action
动作假设
杰西卡
World
时隔十年
AI大牛署名新论文
2026
量子位
ROBO
量子位ROBO
2026-09-24
1 阅读
约9分钟阅读
杰西卡
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 时隔十年,AI大牛署名新论文 杰西卡 2026-09-24 20:58:55 来源: 量子位 杰西卡 发自 ROBO-人 量子位ROBO | 公众号 AI4ROBO 自动驾驶领域再出一篇原创研究论文。 这篇最新论文,让自动驾驶能“走一步想十步”,更像老司机了! 最近,任少卿指导发布论文 《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》 ,提出一种新的多模式世界—动作联合模型。 公开学术记录中,他的代表性研究主要集中在2014—2016年,包括Faster R-CNN、ResNet等一系列计算机视觉经典工作。 这一次,他重新以通讯作者身份出现在自动驾驶论文中。论文第一机构为NIO,多位作者来自蔚来,研究方向也直接指向世界模型和规划。 这篇论文要解决的核心问题很明确:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。 团队的思路是:让模型一次生成多组场景—动作假设,车辆轨迹与对应的未来场景共同演化,最后再从中选择。 简单来说,自动驾驶不仅能看清周围环境,还能预演多种可能的未来,最终选择最安全的路径执行。 从一条轨迹,扩展到多个未来 端到端自动驾驶的基本逻辑,是将传感器观测直接映射为自车轨迹或控制指令。 World–Action Model则进一步增加了未来场景建模,让规划不仅依据当前环境,也参考动作可能带来的后果。 现有的World–Action Model大致存在两类路线: 一类是 级联式方案 。例如先生成几条候选轨迹,再分别预测每条轨迹对应的未来场景;或者先预测未来场景,再基于场景完成规划。这种方式可以生成多个候选结果。 但这种方法的问题也很明确:信息按 单向传递 ,后生成的变量无法回头修正前面的决策。 假如模型已经先确定自车向前通过路口,随后才预测到对向车辆没有减速,这个未来结果很难重新参与前面的动作生成过程。 另一类是 联合式方案 。场景和动作放在同一个生成过程中,两者可以相互影响。 车辆动作变化,预测环境随之调整;环境一旦变化,也会反过来影响车辆轨迹。现有这类方法通常只生成一组场景—动作结果。 论文指出了其中的空白:级联式模型可以覆盖多种驾驶结果,但场景和动作之间缺乏双向交互;联合模型具备双向交互能力,但通常只生成单组结果。 但真实道路往往需要同时处理这两件事。 MM-Future给出的方案是: 一次生成多组场景—动作假设,每一组内部的场景和动作继续共同演化。 每一组结果叫做paired scene–action hypothesis(配对场景-动作假设)。 假设模型同时生成几十组候选,其中一组可能是自车加速、对向车辆让行,另一组是自车减速、对向车辆先行,还有其他不同程度的制动、通过方式以及场景变化。 这些结果不再只有轨迹差异,每条轨迹对应的未来环境也各不相同。由此,多种可能的未来进入规划过程。 同时推演几十个未来,需要面临的三道门槛 论文把多模式联合建模的难点拆成了三项: *多样性从哪里产生,多组未来如何控制计算成本,以及生成多个候选后如何筛选。MM-Future的核心设计也是围绕这三个问题展开。 首先是 多样性问题 。 真实驾驶数据有天然局限,一段录像只记录一种已经发生的结果。司机最终减速,数据中就不会同时留下同一时刻选择加速后的真实场景。模型需要在单结果监督下学出多种合理结果。 MM-Future在动作端根据训练轨迹分布建立了Gaussian Mixture Noise,从不同动作先验出发;场景端则使用独立噪声。 动作与场景的初始状态两两配对,构成了不同驾驶结果的独立起点。 训练时又加入 Best-of-Many监督 。模型一次生成多组候选,先找出与真实轨迹最接近的一组,再用同一个赢家索引监督动作流和场景流。 这样可以避免所有候选被同一条真值轨迹拉向相似结果,也能保持一条轨迹和它对应的未来场景始终配对。 其次是 计算成本 。多视角视频如果按每种候选完整展开,模式数量和预测时间一增加,计算量会迅速上升。 作者提出了 MM-Tokens ,将 多摄像头、多时间帧 的视觉特征压缩为面向规划的紧凑表示。 MM-Tokens不承担RGB图像重建,也不需要恢复完整BEV。有限的Token预算主要保留与未来演化和驾驶规划相关的信息。 从论文给出的注意力可视化来看,MM-Tokens关注的信息主要集中在 道路结构、路口、前车以及周围交通参与者等区域 。 模型由此无需为几十种候选分别生成完整的高清未来视频,内部保留的是一组面向规划的紧凑未来场景表征。 第三项是 场景与动作如何共同演化,以及多组候选如何筛选 。MM-Future使用了modality-aware Transformer同时处理动作流和场景流。 共享注意力负责两类信息的交互,模态专属分支保留两类数据各自的统计特征。 每一组候选共享模型参数,但不同模式之间不交换Token。 因此,动作轨迹会随着配对场景的变化继续更新,场景预测也会根据自车动作重新调整。多轨迹规划由此引入了动作与环境的双向耦合。 生成结束后,Future-Conditioned Proposal Scorer负责完成最后筛选。 它评估一条候选轨迹时,同时读取历史信息和这条轨迹专属的预测未来,再给出分数。每个候选只能读取自己配对的未来,不能借用其他模式的场景结果。 论文还对轨迹和未来Token使用stop-gradient,避免生成器为了提高评分而改变输出分布。 最终推理过程可以压缩成四步:编码历史观测,生成多组场景—动作结果,使用历史与配对未来给候选评分,再输出得分最高的轨迹。 世界模型开始更深层进入规划 MM-Future最终带来了多大提升呢? 论文使用 NAVSIM 和 HUGSIM 两套基准进行了测试: 在NAVSIM-v1 navtest上,使用trainval数据训练的MM-Future获得94.0 PDMS。同一张结果表中,WAM方案DriveFuture为90.7,E2E方案DrivoR trainval为93.7。 NAVSIM-v2上,MM-Future获得91.5 EPDMS,高于论文列出的UniTeD 90.1和DriveFuture 89.9。 更能说明方法效果的是 消融实验 。 只生成动作、仅保留一种模式时,PDMS为84.1;把动作候选增加到32种后提升到92.3。 加入场景—动作联合生成后,单模式为85.1,32模式达到92.9。最后让评分器读取每条轨迹对应的预测未来,PDMS继续提升到93.3。 几组对照分别验证了三个环节:增加模式数量带来主要增益;场景和动作联合生成还能继续提升;配对未来参与候选评分后,规划指标再次改善。 评分器带来的提升在 TTC指标 上最明显,论文据此认为:候选专属未来主要帮助模型排除交互风险较高的轨迹。 多模式训练还表现出更快的收敛速度。16模式和32模式达到0.80
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱