Lesson 04 · Architecture evolution

架构为什么一步步变成今天这样

架构变化不是模型名称接力。每一代方法都在修补前一代暴露的输入歧义、几何不足、训练分布或任务配合问题。

预计 35–45 分钟 按问题而非年份记忆 含 4 道即时题

本课使用一条固定句式

“旧方法做不到 什么,新方法加入 什么机制,但它又留下 什么证据缺口。”

用这句话记架构,比背论文年份更稳定。下面七个节点不是完整历史,而是一条适合入门的主线。

1. 直接视觉控制:先证明映射能学

早期视觉驾驶工作已经尝试从道路图像预测转向。2016 年 NVIDIA 的 PilotNet 路线 把单个前视相机像素直接映射到转向命令,并用人类驾驶动作监督。

前视图像raw pixels
CNNimplicit road features
转向steering command

修补的问题:人工车道检测、道路边缘和规划接口可能丢掉与驾驶相关的信息。转向损失可以直接塑造视觉特征。

留下的问题:单一动作监督信息量小;没有明确导航任务;偏离恢复数据不足;长时意图和周围交通交互难表达。

2. 条件驾驶:同一画面可以有多种正确动作

路口画面本身无法决定该左转还是右转。Conditional Imitation Learning 把高层命令加入策略,在网络内部使用不同控制分支或条件表示。

图像 + 速度what is happening
共享视觉编码sensorimotor features
命令条件left · right · straight
控制command-specific action

修补的问题:把任务意图与场景观测分开,避免一个画面对应互相矛盾的训练标签。

留下的问题:粗粒度命令不能给出精确路线;单目几何和动态交互仍然困难;策略仍依赖专家日志覆盖。

3. 特权教师:让学生先学“怎么开”,再学“怎么看”

Learning by Cheating 把难题拆成两个阶段。教师读取仿真器中的完美道路布局和交通参与者位置,先学习或执行较好的驾驶;学生只看相机,模仿教师。

Roach 用强化学习训练读取 BEV 特权信息的教师,让教师提供大规模 on-policy 与 off-policy 监督,再训练单目学生。

修补的问题:直接从图像同时学感知和决策太难,专家人类日志又缺少密集纠错状态。特权教师把几何与交互策略先学稳。

留下的问题:教师上限、仿真偏差和知识转移误差会限制学生;教师看见的信息,学生未必能从像素可靠恢复。

4. 传感器融合:单一视角不足以支持复杂交互

TransFuser 使用相机和 LiDAR,在多个分辨率用 Transformer 模块融合透视图与 BEV 特征。目标是闭环驾驶,不只是提高检测分数。

Camerasemantic appearance
多尺度融合cross-sensor attention
Waypointsfuture ego motion
Controltrajectory tracking
LiDARmetric geometry

修补的问题:图像语义强但深度间接,LiDAR 几何强但语义稀疏。跨模态 attention 让规划特征同时读取两者。

留下的问题:传感器成本、标定误差和融合时序会增加系统复杂度;CARLA 中的收益不自动等于真实道路收益。

5. 轨迹与控制双分支:短期动作需要长期意图

一类方法预测轨迹后用控制器跟随,另一类直接预测控制。TCP 把两条路线放进同一模型:trajectory branch 预测未来位置,control branch 预测多步动作,轨迹信息指导控制。

修补的问题:直接控制缺少显式长期几何,轨迹控制又可能受跟踪器误差影响。双分支让两种监督互相约束。

留下的问题:两个分支可能冲突,融合规则要决定最终动作;模型在一个仿真排行榜上的领先仍需检查数据与评测协议。

6. Planning-oriented:中间任务都要回答“是否帮助规划”

UniAD 把检测、跟踪、在线地图、运动预测、occupancy 和规划放在一个网络中,用 query 接口传递信息,并以规划为最终目标。

多相机surrounding views
Track + Mapagents and lanes
Motion + Occupancypossible futures
Planningego trajectory

修补的问题:顺序模块的误差会累积,任务各自优化时可能配合不足。统一 query 和联合训练让上游表示按规划需要调整。

留下的问题:多任务损失难平衡;复杂结构可能让真正贡献难归因;nuScenes 日志评测与完整闭环驾驶之间仍有距离。

7. 向量化规划:别把整个世界都画成稠密像素

VAD 把周围目标运动和地图元素表示为向量,用它们作为实例级规划约束。相比稠密栅格,向量更直接表达“哪辆车”“哪条车道”和它们的几何关系。

修补的问题:稠密 raster 表示计算量大,实例结构不明显。向量化表示适合规划器读取目标与地图关系。

留下的问题:向量依赖检测与地图抽取;未被实例化的障碍可能消失。Occupancy 与向量表示常有互补关系。

现代系统的共同骨架

把论文名拿掉,很多现代系统可以压成下图:

多视角与状态sensors · ego · route
共享场景编码BEV · queries · vectors
结构化辅助任务map · motion · occupancy
规划与控制trajectory · action

差异主要落在四个选择:输入传感器、场景表示、任务连接方式和最终评测。Transformer 只是完成特征交互的一类工具。

工作主要新增机制最该检查的证据
NVIDIA像素直接到转向道路范围、恢复能力、控制稳定性
Conditional IL高层命令条件路口任务完成和未见城镇泛化
Learning by Cheating / Roach特权教师到视觉学生教师上限、转移损失、仿真域差
TransFuser相机与 LiDAR 多尺度融合闭环碰撞、传感器消融、路线一致性
TCP轨迹与控制双分支分支消融、冲突处理、闭环分数
UniAD规划导向多任务 query规划收益、任务贡献、评测闭环性
VAD向量化场景与规划约束漏检敏感性、效率、碰撞指标

即时检查

题 1 · Conditional IL 主要解决什么?

题 2 · 特权教师为什么不能直接部署?

题 3 · Planning-oriented 最重要的判断是什么?

题 4 · 向量表示最依赖什么前提?

迁移练习:不要被新模型名带走

某新论文使用八路相机、BEV encoder、object queries、occupancy head 和 trajectory decoder。作者称其为“统一端到端驾驶基础模型”。

请用“旧问题 → 新机制 → 证据缺口”写 150–250 字:

  1. 它可能继承了哪几条架构路线?
  2. 这些组件分别修补什么问题?
  3. 仅凭组件列表,哪些主张无法成立?
  4. 你最想看哪两个消融实验?

把答案发给我,可以一起审一遍它的证据链。下一课会专门解释为什么“指标更高”经常不是完整答案。

本课压缩

  1. 直接控制证明传感器到动作可以学习,但缺任务条件、恢复数据和长期结构。
  2. 条件驾驶、特权教师和传感器融合分别修补任务歧义、训练难度与几何信息不足。
  3. TCP 连接轨迹与控制,UniAD 连接多任务与规划,VAD 改变场景表示粒度。
  4. 现代架构没有沿着“模块越来越少”单向发展,而是重新加入可训练的结构。
  5. 任何新机制都要配对应证据:传感器消融、任务贡献、闭环行为和失败分布。

首选资料与选读

  1. 首选:TransFuser用五问框架读摘要和总架构图,不追 decoder 细节。
  2. TCP比较 trajectory branch 与 control branch 的信息流。
  3. UniAD 项目页找出六个任务以及它们通向 planning 的路径。
  4. VAD重点读 dense raster 与 vectorized representation 的对比。