智能AI
morning
ECCV 2026|自驾VLA Scaling有戏了,北航清华DriveTeach-VLA:用图像评分打通驾驶场景与基模预训练
摘要
论文的团队来自于清华大学产业研究院(AIR),滴滴,北京航空航天大学。团队近年在自动驾驶与具身智能领域发表论文数十篇,并和国内外知名高校、科研机构广泛开展合作。 该论文的第一作者为杨予光,北京航空航天大学博士研究生,研究方向为自动驾驶与具身智能,提出首个 MLLM 原生自动驾驶模型 CuriousVLA,也是当前自动驾驶领先模型 CLOVER 的重要贡献者。迄今已在 ICLR、NeurIPS、CV...
VLA
DriveTeach
Vision
What
See
learns
北京航空航天大学
ECCV
Teaching
Language
2026-08-11
1 阅读
约10分钟阅读
机器之心
字号:
论文的团队来自于清华大学产业研究院(AIR),滴滴,北京航空航天大学。团队近年在自动驾驶与具身智能领域发表论文数十篇,并和国内外知名高校、科研机构广泛开展合作。 该论文的第一作者为杨予光,北京航空航天大学博士研究生,研究方向为自动驾驶与具身智能,提出首个 MLLM 原生自动驾驶模型 CuriousVLA,也是当前自动驾驶领先模型 CLOVER 的重要贡献者。迄今已在 ICLR、NeurIPS、CVPR、ICCV、ECCV 等顶级会议发表论文 7 篇,长期担任相关顶会审稿人,并获 CCF 中国计算机学会年度应用奖励。 本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。 该工作聚焦于自动驾驶场景中的自回归型 VLA 模型的训练,主要的观点是现有 VLA 的交通相关数据在很大程度上依赖以文本为中心的视觉问答和思维链推理数据,这类数据更强调语言推理,而非基于动作的规划。为解决这一问题,该工作提出利用交通要素蒸馏的方式纠正 VLA 模型的关注要素,使其更加关注视觉要素;同时,该工作还提出了一种将 BEV 轨迹映射到图像像素空间进行学习的技术,这能够充分利用基模已有的视觉能力,使轨迹内在的空间含义对模型更加可理解。DriveTeach-VLA 在 NAVSIM 上进行了评测,达到 90.4 的 PDMS;在进一步运用 Drivor 轨迹选择器后 PDMS 可以提升至 92.7,取得了当前最先进的性能。 论文题目:Teaching Vision-Language-Action Models What to See and Where to Look 合作机构:北京航空航天大学,清华产业研究院,滴滴,中国传媒大学 论文链接:https://arxiv.org/pdf/2607.01658 项目主页:https://github.com/ShivaTeam/DriveTeach-VLA 研究背景与挑战:自动驾驶模型无法从互联网预训练中获益 设想一个并不罕见的情景:自车准备左转,右侧有行人靠近斑马线,前方的大车遮住了部分视野。得益于多模态基模在互联网数据中习得的强大预训练能力,如今视觉 — 语言 — 动作模型(VLA)已经能把这种场景的应对措施描述得很好:应该减速、观察、礼让行人,然后再左转。但是,这种大语言模型均具备的能力,真的能决定车辆驾驶与控制的安全吗?真正决定安全的,是模型生成轨迹时究竟看向了哪里:它有没有盯住行人?有没有理解被遮挡区域?所谓 “左转”,又是否对应到画面中那条真实可行驶的车道? 论文通过几个例子非常直观展示了这种机制的必要性,下图 (a) 是一个常见的 VLA 模型基线,使用 Qwen2.5-VL 适配自动驾驶数据,结果模型的关注点是非常分散的分布在图上,并没有明确的注意力焦点。论文分析这种注意力失焦的问题主要是由于现在的 VLA 训练实际上是在把大语言模型当作一个大的拟合器在用,VLA 只是独立的学习如何根据场景输出对应的思维链和给出对应的轨迹,并没有真正 “明白” 思维链与轨迹预测之间的关系。 DriveTeach-VLA 清华北航团队认为,VQA 和思维链可以教模型理解交通语义,却不能自动保证语言推理与控制所对应的规划空间是一致的。因此,该论文的思路是,让模型学习如何在轨迹推理的时候关注那些语言推理中涉及到的视觉要素,从而最后影响车辆轨迹的生成。简单说,就是先教模型哪些地方值得关注,再教它接下来应该看哪里,从而引导模型把注意力聚焦于车道,行人,红绿灯等与交通规则密切相关的位置。 具体来说,DriveTeach-VLA 没有继续堆叠更长的思维链解释文本,而是把视觉 - 语言 - 动作训练拆成三件更具体的事:先教模型识别什么值得看(learns what to see),再告诉它未来应该看向哪里(learns where to look),最后校正它怎么开(learns how to drive)。 第一课:把交通常识教进视觉编码器(What to See,DVD Pretraining) VLA 之所以运用多模态大模型作为基座,是因为在预训练过程中见过海量的图片可以提供大量的世界先验知识。但是,在具体的自动驾驶场景中,路边广告牌和正在横穿的行人,对下一秒轨迹的重要性完全不同。因此,DriveTeach-VLA 设计了驾驶知识驱动的视觉蒸馏方法( Driving-aware Vision Distillation,DVD)。 训练时,首先由 GroundingDINO 先标出车辆、行人、路障和交通灯等关键对象;论文希望 VLA 能够尽可能多的关注这些关键对象, 为此,论文参考了牛津大学视觉几何组(VGG)对CLIP的视觉提示研究工作 ,只要在图像上用明显的视觉标识标记物体,就能直接改变模型的注意力。为此,运用了自蒸馏的思想,将 VLA 基座的 ViT 拷贝为学生 ViT 和教师 ViT,由 GroundingDINO 标注出的 bbox 框标注在图像上,输入给教师 ViT,而学生 ViT 只读原图。 教师 ViT 由于受到 bbox 框标注的引导,注意力会自然偏向于那些被标记的交通要素,而学生 ViT 则直接学习这些被注意力矫正后的特征。这样一来,教师所拥有的 “交通对象提示”,可以通过蒸馏算法迁移给学生。在蒸馏方式方面,论文使用的则是类似 Swin Transformer 的块级感知蒸馏,也就是将特征图先分块后再平均池化,这样尽可能多的获取到由框矫正带来的特征变化。 论文还进一步尝试给 GroundingDINO 输出的标注框通过随机丢弃(Random drop)和框扰动(Jitter bbox)检验由 GroundingDINO 这种预标注带来的性能增益是否稳定。实验结果显示出 DVD 能带来约 1.4 的 PDMS 改善,而且在增加了 20% 的噪声后,DVD 依然能带来良好的性能增益。 第二课:在画面里指出 “未来要走的地方”(Where to Look,2D-TGP 图像轨迹) 论文还从基座预训练的角度给出了一个见解,认为现在大家将多模态模型基座想象成了在自驾领域需要从头开始学习的模型。但实际上,多模态模型基座受益于预训练时大量的数据,对于交通、路况等场景的理解能力的适配是很容易学习的。而真正的瓶颈在于自动驾驶规划通常在鸟瞰(Bird-Eye-View,BEV)坐标系中输出轨迹,这种轨迹的含义对于基模而言是难以被直接理解的。 为此,DriveTeach-VLA 引入 2D Trajectory-Guided Prompt(2D-TGP):利用相机内外参,把专家驾驶轨迹从 BEV 坐标系投影到图像平面上,得到一串像素坐标;随后再把这些像素坐标组织成文本形式,作为提示输入给 VLA 模型。这样一来,模型看到的不再只是 “左转” 这种语义指令,而是同时获得了一个更具体的视觉参照:未来轨迹大致应该经过图像中的哪些位置。而幸运的是,多模态基模在预训练时已经习得了很好的读图能力,2D-TGP
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱