首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

物理AI重塑智驾

摘要

当年3月13日,莫哈韦沙漠,由美国国防部高级研究计划局(DARPA)主办的DARPA自动驾驶汽大挑战赛正在这里举行。这是世界上首个自动驾驶汽车长距离比赛,卡内基梅隆大学、斯坦福大学、麻省理工以及大众、英特尔等15支团队参加角逐。 不过,早期的智能驾驶只能算是辅助工具,依赖规则算法与高精地图,理想甚至将其类比为“昆虫动物智能”。这种模块化割裂的设计,导致系统泛化能力孱弱,无法达到拟人化的水平; 感知...

端到端 一段式 当年3月13日 莫哈韦沙漠 由美国国防部高级研究计划局 DARPA 主办的DARPA自动驾驶汽大挑战赛正在这里举行 这是世界上首个自动驾驶汽车长距离比赛 卡内基梅隆大学 斯坦福大学
2026-08-06 1 阅读 约10分钟阅读 巨潮WAVE
分享:
字号:
当年3月13日,莫哈韦沙漠,由美国国防部高级研究计划局(DARPA)主办的DARPA自动驾驶汽大挑战赛正在这里举行。这是世界上首个自动驾驶汽车长距离比赛,卡内基梅隆大学、斯坦福大学、麻省理工以及大众、英特尔等15支团队参加角逐。 不过,早期的智能驾驶只能算是辅助工具,依赖规则算法与高精地图,理想甚至将其类比为“昆虫动物智能”。这种模块化割裂的设计,导致系统泛化能力孱弱,无法达到拟人化的水平; 感知、预测、决策、控制模块化分而治之的思路,逻辑性强,但传输过程不可避免产生误解和损耗。 因此,端到端方案焕发生机。 2024年3月,特斯拉在北美推送FSD V12版本,其最大的突破是将感知、决策与控制整合为单一神经网络模型,内部称为"Photon In, Control Out",移除了30万行手写代码,用神经网络取代,实现了感知和决策规划两大模块的算法“端到端”,彻底重构了技术架构。 跟随特斯拉的脚步,国内分段式端到端在2024—2025年大规模落地,一段式端到端与VLA技术则在2025—2026年集中上车。 彼时,业内分为“一段式”和“两段式”两个流派,华为、百度Apollo、小鹏等都是两段式玩家,商汤、Momenta等则是“一段式”的拥趸。 时至今日,一段式端到端已成主流。不过早期端到端技术存在明显短板,它是一个“黑箱”,人们难以追溯其决策逻辑,事故发生后也无法快速定位问题。 为此,行业转向VLA(视觉-语言-行动模型),它实现了自动驾驶的“真”端到端。通过融合计算机视觉、自然语言处理与强化学习,构建了集环境感知、语义理解与决策执行的统一智能体,完成了从“黑箱”到“可解释大脑”的变革。 随着物理AI的到来,达到人类智能甚至“超越人类智能”成为可能。在保证高效响应的同时,物理AI让决策逻辑更具可解释性。 未来五年,VLA与世界模型这两条路线的深度融合,或将成为终极方案。L3/L4高级别乃至无人驾驶的世界即将来临。 融合 “VLA对自动驾驶是锦上添花,很难雪中送炭。” Momenta CEO曹旭东认为VLA的训练起源于LLM,其训练侧重点(语义)与自动驾驶的实际需求存在明显偏差。这也就意味着,VLA语义的优先级远高于驾驶,陷入了“好钢没用在刀刃上”的困境。因此,Momenta坚定地选择了世界模型路线。 无独有偶,华为车BU CEO靳玉志也秉持类似的观点。他认为,VLA通过语言大模型将视觉信息转化为文本token再进行决策,看似捷径,实则无法真正理解物理世界。VLA就像“背题库的学生”,在复杂或突发场景容易失效;而世界模型虽研发难度更大,但那才是自动驾驶的终极彼岸。 华为倾向于‌WA(World-Action,世界-动作)‌路径,即跳过语言中间层,直接利用多源感知(视觉、声音、触觉等)构建理解因果逻辑的世界模型,实现更本质的自动驾驶能力。 进入2026年,特斯拉FSD V14的推出改变了行业认知,大模型能力不是在VLA和世界模型之间二选一,而是两者的深度融合。特斯拉在新版本中集成了xAI的Grok大模型,同时利用世界模型进行‌数据生成与闭环仿真‌。 行业迅速形成了一套被广泛接受的共识。黑芝麻智能CEO单记章就此得出:“VLA加上世界模型,是智能驾驶未来最有可能的技术路线,而且有机会超越人类的驾驶能力。” 如果说,端到端是技术路线,那么VLA和世界模型就是在这个路线上分出了两个不同方向上的强化,VLA增强了理解,世界模型强化了预测。 世界模型的做法是直接给汽车装上一个“智能大脑”,他能模拟物理世界的运行规律,不依赖工程师预设的规则,而是提前通过海量真实数据训练,让模型拥有理解预测物理世界的能力。 因此,VLA解决的是理解当下的问题,世界模型解决的是预测未来的难题。 时下的实际产业发展中,VLA+世界模型的融合方案成为越来越多车企的选择。小鹏曾被认为坚持VLA路线,但在CVPR 2026 大会上,小鹏通用智能中心负责人刘先明明确指出,‌VLA与世界模型并非“二选一”的相互对立关系‌,而是共同构成小鹏物理世界基座模型的两大支柱。 小鹏发布的X-Mind,正是将预测性世界模型内嵌为VLA模型的视觉思维链,让模型在输出动作之前先完成时空推演。 蔚来在1月也已将世界模型加闭环强化学习架构推送至数十万辆车,地平线在6月底发布的HSD V2.0也采用世界模型+端到端强化学习的双引擎。 可见,一种深度融合式的方案,已经在全行业铺开。 终局 越来越多的汽车和智能驾驶公司将自己定义为“物理AI企业”。 马斯克近年来一直在全球兜售他的“AI宏图”,他说,特斯拉正在从一家汽车公司转变为一家AI公司,未来的成长空间主要是自机器人、自动驾驶和AI基础设施。 李想也把理想汽车重新定位为一家人工智能企业;何小鹏将小鹏汽车的定位升级为“物理AI世界的出行探索者,面向全球的具身智能公司”;Momenta更是被称为“物理AI第一股。轻舟智航宣布战略重心从“无人驾驶”全面升级为“通用物理AI”,卓驭科技则转向“移动物理AI”,并提出“未来存活下来的智驾公司都将是物理AI公司”。 物理AI浪潮下,智能驾驶逻辑已经从价格战、堆配战转向“基模”之战。 过去汽车行业的竞争是“堆配置”,激光雷达数量、芯片算力、续航里程,比拼的是参数堆叠。而在物理AI时代,竞争逻辑变为“建底座”,谁掌握物理世界的理解与行动能力,谁就掌握价值链主导权。 甚至,世界模型让智驾、座舱和机器人以及一切智能终端走向技术融合。特斯拉用同一个基础模型驱动FSD、Optimus和智能体;用单一端到端神经网络取代模块化架构,实现从自动驾驶汽车到人形机器人Optimus的基础模型统一。 理想汽车也已将‌基座模型‌与‌VLA‌研发团队合并,以统一技术底座支撑‌智能驾驶‌、‌智能座舱‌及‌人形机器人‌三大业务线;高通把汽车与机器人放进同一个事业群。 华为ADS 5.0搭载WEWA 2.0,云端引入Multi-Agent多智能体群体博弈,让无数AI驾驶者互相博弈学习;Momenta R7世界模型已实现量产首发;蔚来NWM是中国首个智驾世界模型。 不过,目前所有的智驾系统距离真正的物理AI终极形态还相去甚远。一方面,相比大语言模型,世界模型需要巨量的真实世界数据,截至2026年5月,FSD(监督版)车队累计行驶突破‌100亿英里‌(约160亿公里),位居全球第一,而其他新势力品牌由于车辆数较少,累计里程均在数十亿公里,未来还需数据量的积累。 其次,物理AI还需高算力芯片和大规模模型训练。有消息显示,特斯拉可能握有约23万张H100等效算力;小鹏Robotaxi则瞄准了L4级无人驾驶,搭载4颗图灵AI芯片,车端算力高达3000TOPS,号称全球最强; 靳玉志此前表示,2026年华为乾崑智驾研发投入将超180亿元,未来5年将至少再砸下700亿元用于AI算力的提升,其算力规模在29个月的周期里实现了21倍增长。 随着头部智驾企业迈入物理AI赛道,算力竞赛将再上升一个台阶。 写在最后 1988年.莫拉维克在其著作《智力后裔》中明阐述这样一个观点:对人类来说很难的任务(如逻辑推理、下棋),AI 反而容易完成;而对人类来说很简单的事(如走路、抓取物体),AI 却极难实现‌。 后来,这一问题被业界称为“莫拉
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱