自动驾驶必读论文地图:14 篇串起整个行业

这个需求很有价值——一份能"从地基串到屋顶"的论文清单,比零散读十几篇有用得多。经典部分(Transformer→BEV→端到端)我很有把握,但 2025-2026 年 VLA 和世界模型的最新代表作需要先核实,避免给你推荐过时或错误的论文。让我查一下。VLA 综述已确认。再查一下世界模型方向的代表作,确保华为那条线也串得准。信息足够了。华为 ADS 的世界模型(WEWA 架构)没有公开论文,但它的技术根源就是 GAIA-1/DriveDreamer 这条学术线,串联逻辑已经清晰。现在给你整理这份论文地图。


自动驾驶必读论文地图:14 篇串起整个行业

先给你全局视图:四层金字塔

这 14 篇论文不是平铺的,而是四层递进的技术栈——每一层解决上一层留下的问题,最后正好落在小鹏 VLA 2.0、FSD v14、华为世界模型这三座"屋顶"上:

第四层【前沿范式】 VLA / 世界模型        ← 小鹏VLA2.0、华为WEWA、FSD v14在这
第三层【端到端】   UniAD / VAD           ← 行业2023-2024的主战场
第二层【BEV感知】  LSS / BEVFormer       ← 你已经学过的,行业基石
第一层【地基】     Transformer / ViT     ← 一切的源头

阅读总原则:按层往上读。跳层读会痛苦(比如没读 Transformer 直接读 BEVFormer,注意力机制那部分会看不懂)。


第一层:地基(2 篇)——不读这两篇,后面全是天书

① Attention Is All You Need (2017, Google)

解决的问题:RNN 处理序列又慢又记不住长依赖。这篇论文发明了 Transformer——纯注意力机制,并行计算、全局感受野。

为什么智驾必读:你后面要读的每一篇(BEVFormer、UniAD、VLA、GAIA-1)全部建立在 Transformer 上。FSD v14 是"一段式端到端 Transformer 神经网络",小鹏 VLA 2.0 的底座也是。这篇不懂,后面全部似懂非懂。

重点读:Section 3(架构)+ 3.2(注意力计算公式)。你之前问过的"256 维 d_model"就出自这里。

② ViT: An Image is Worth 16x16 Words (2020, Google)

解决的问题:Transformer 只能处理文字序列,图像怎么办?答案:把图像切成 16×16 的小块(patch),每块当一个"词"。

为什么智驾必读:这是"图像进 Transformer"的开山之作。BEVFormer 把图像特征当 token、VLA 把摄像头画面变 token,源头都是 ViT 的 patch 思想。你问过的"视觉 token"概念就是从这来的。


第二层:BEV 感知(3 篇)——你已有基础,重点补 LSS

③ LSS: Lift, Splat, Shoot (2020, NVIDIA)

解决的问题:多个相机的 2D 图像怎么变成统一的 BEV 俯视图?LSS 的答案:"Lift"——给每个像素预测一个深度分布,把 2D 像素"抬"到 3D 空间;"Splat"——把 3D 点拍扁到 BEV 网格。

为什么必读:这是 BEV 方法的两大流派之一(前向投影派)。你学的 BEVFormer 是另一派(反向查询派)。面试必考题:"LSS 和 BEVFormer 的投影方向有什么本质区别?"——LSS 从图像出发往 BEV 推(forward),BEVFormer 从 BEV 格子出发往图像查(backward)。读完这篇你才算两派都懂。

④ BEVFormer (2022, 上海AI Lab)

解决的问题:LSS 依赖深度估计(不准),BEVFormer 用"BEV query 主动去 6 路相机查询特征"绕开显式深度估计,还加了时序自注意力解决遮挡和速度估计。

你已经深度学过(我们做的那份 HTML 讲解),这里只需重读论文本身验证理解。重点读:Fig 2(架构图)、Spatial Cross-Attention 公式,对照你玩过的那个交互式投影演示。

⑤ Occupancy Networks 思想 → Tesla AI Day 2022 (讲座, 非论文)

解决的问题:3D 框检测有个致命盲区——没见过的异形物体(侧翻的卡车、掉落的货物)检测不出来。占据网络不输出"框",输出"空间里每个体素被占没被占",管你是什么东西,占了就绕。

为什么放这:这是特斯拉纯视觉路线的核心一环,也是理解 FSD 感知的钥匙。没有正式论文,看 Tesla AI Day 2022 视频(YouTube)+ 网上解读文章即可。学术界对应的是 TPVFormer/SurroundOcc,有余力可翻。


第三层:端到端(3 篇)——2023-2024 行业主战场

⑥ UniAD: Planning-oriented Autonomous Driving (2023, 上海AI Lab, CVPR 最佳论文)

解决的问题:传统模块化流水线(感知→预测→规划各自独立训练)存在误差累积、目标不一致——感知优化 mAP,但 mAP 高不等于开得好。UniAD 把 5 个模块(跟踪/建图/轨迹预测/占据/规划)用统一的 query 串起来联合训练,所有模块为最终规划服务。

为什么必读:这是"模块化端到端"的巅峰,也是你理解"为什么行业要端到端"的最佳教材。你 Project 2 学的就是它。重点读:Fig 1(planning-oriented 设计哲学)、各模块 query 怎么传递。

⑦ VAD: Vectorized Scene Representation (2023, 华中科大+地平线)

解决的问题:UniAD 太重(栅格化表示计算量大,跑不到实时)。VAD 把场景全部矢量化(车道线是向量、轨迹是向量),速度快约 10 倍,首次让端到端逼近实时可部署。

为什么必读:这是"学术端到端"走向"量产端到端"的关键一步。你之前问的"导航命令 one-hot 向量"就是 VAD 的输入设计。它也是理解小鹏/理想量产方案的最佳学术参照。

⑧ DriveVLM (2024, 清华+理想)

解决的问题:纯端到端网络遇到长尾场景(临时交警手势、异形障碍、罕见路况)泛化差,因为训练数据里没有。DriveVLM 引入视觉语言大模型(VLM)做"慢思考":大模型理解罕见场景并给出建议,传统端到端管"快反应",双系统协作。

为什么必读:这是"大模型上车"的代表作,也是从第三层(端到端)通向第四层(VLA)的桥。理想量产的双系统方案(快慢系统)就源于此。


第四层:前沿范式(4 篇 + 2 综述)——直通三家量产系统

⑨ GAIA-1 (2023, Wayve)

解决的问题:怎么让模型"理解世界如何运转"而不只是"模仿人类开车"?GAIA-1 是首个大规模驾驶世界模型——输入视频/文本/动作,预测并生成未来的驾驶场景视频。它学到的不是"这个场景该打多少方向盘",而是"世界接下来会发生什么"。

为什么必读:世界模型这条线的开山之作。GAIA-1 通过在大量真实驾驶数据上训练,学习并理解了真实世界的规则和驾驶场景中的关键概念,可以预测多种可能的未来,甚至包括超出其训练集的动作和场景——这展示了其理解和推断训练集中不存在的驾驶概念的能力。华为 ADS 的世界模型宣传(WEWA 架构)技术根源就是这条线——华为没公开论文,但读懂 GAIA-1 你就懂了华为在做什么。

⑩ DriveDreamer (2023, GigaAI+清华)

解决的问题:GAIA-1 生成的场景不够"可控"。DriveDreamer 引入扩散模型让世界模型的环境表征更强,能按 HDMap、3D 框、文字提示精确控制生成内容(指定天气、时间、车辆动作),专门生成训练数据里稀缺的长尾场景

为什么必读:世界模型的第一大落地价值就是"数据工厂"——驾驶场景生成允许进行模拟测试,丰富数据组成,增强系统在复杂场景中的能力。理解了它,你就理解了为什么各家车企都说"用世界模型造数据训练端到端模型"。这也正好接上你 Project 2 里的 World Model 章节。

⑪ VLA 综述: A Survey on Vision-Language-Action Models for Autonomous Driving (2025, ICCV Workshop)

解决的问题:VLA 论文太多太散,这篇综述形式化了近期工作共享的架构组件,追溯了从早期解释器到以推理为中心的 VLA 模型的演化,并对比了20多个代表性模型。

为什么必读:一篇顶二十篇。它把三种范式的演进关系讲透了:端到端驾驶提供直接的感知到控制映射但缺乏可解释性和泛化能力;VLM4AD 引入自然语言推理和可解释性但仍以感知为中心;VLA4AD 整合感知、推理和行动,实现可解释且鲁棒的闭环控制。读完这篇,你就能精准理解小鹏 VLA 2.0"砍掉语言层做 V-A"是在这个演化谱系的哪个位置、为什么这么做

⑫ OpenVLA (2024, Stanford)

解决的问题:VLA 模型怎么开源落地?OpenVLA 给出了完整的开源实现(视觉编码器+LLM+动作头),是学术界复现 VLA 的标准起点。

为什么必读:你 Project 2 的 MiniVLA(Qwen2.5-VL+LoRA 输出轨迹)本质就是 OpenVLA 思路的简化版。读它能验证你自己搭的架构哪里对、哪里可以改进。机器人和驾驶的 VLA 是同一套范式——小鹏说 VLA 技术栈复用于人形机器人,就是这个原因。

⑬⑭ 两篇兜底综述(工具书,不用精读)

  • 《Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future》(2025 末)——最新的 VLA4AD 全景图,配套 GitHub 仓库持续更新论文列表,当"追新雷达"用
  • 《The Role of World Models in Shaping Autonomous Driving》(2025)——世界模型综述,把 GAIA-1/DriveDreamer/Vista/Drive-WM 等谱系整理清楚,当"世界模型地图"用

推荐阅读顺序与时间规划

结合你 15h/周、主力还要跑 Project 2/3 的现实,论文阅读建议穿插进行,每周 1-2 篇精读

周次 读什么 预期收获
第1周 ① Transformer 注意力机制彻底通透(配合你已学的 256 维概念)
第2周 ② ViT + ③ LSS 视觉 token + BEV 两大流派补全
第3周 ④ BEVFormer 论文原文 验证 HTML 讲解学到的理解
第4周 ⑥ UniAD 端到端设计哲学(配合 Project 2)
第5周 ⑦ VAD 量产化端到端 + 导航输入设计
第6周 ⑧ DriveVLM + ⑤ Tesla AI Day 视频 大模型上车 + 占据网络
第7周 ⑪ VLA 综述 一篇看懂 VLA 全景
第8周 ⑨ GAIA-1 + ⑩ DriveDreamer 世界模型两连发(配合 Project 2 WM 章节)
有余力 ⑫ OpenVLA + ⑬⑭ 综述 对照自己的 MiniVLA + 追新工具

三家量产系统怎么被这 14 篇串起来(最终拼图)

特斯拉 FSD v14:①Transformer + ②ViT(架构底座)→ ⑤占据网络(感知)→ 端到端思想(⑥⑦的极致版:一段式大网络直接出控制)+ 强化学习后训练

小鹏 VLA 2.0:①② 底座 → ④BEV 感知遗产 → ⑧⑪ VLA 谱系 → 创新点是砍掉 L 层做"V-A"直连(⑪综述里能找到这个演化逻辑)+ ⑨⑩世界模型做数据引擎

华为 ADS(世界模型宣传):④BEVFormer 类感知(GOD 网络)→ ⑨GAIA-1/⑩DriveDreamer 这条世界模型线的工程化落地 + 多传感器融合(激光雷达路线)

读完这份清单,你看任何一家车企的发布会,都能立刻定位"这个功能对应哪篇论文的思想、创新点在哪、吹牛的成分有多少"——这正是面试时最值钱的判断力。


一个实用建议:每读完一篇,用你熟悉的方式写 200 字"这篇解决了什么问题 + 和我的 Project 2/3 哪里有关",存成笔记。8 周后这份笔记本身就是你面试前的最佳复习材料。需要的话,我可以为其中任何一篇做像 BEVFormer 那样的深度 HTML 拆解——你读到哪篇卡住了随时说。

为者常成,行者常至