Lesson 06 · Models beyond the policy

世界模型、VLM 和数据闭环

世界模型预测“如果这样做会发生什么”,VLM 处理语言与语义关系,数据闭环决定系统下一轮学什么。它们解决的是不同接口。

预计 35–45 分钟 课程收束 含 4 道即时题

先拆掉“基础模型会统一一切”的想象

端到端驾驶仍要处理五个问题:看什么、保留什么表示、输出什么、怎样学习、怎样评测。世界模型主要扩展“未来如何变化”,VLM 主要扩展“语义和语言怎样进入系统”,数据闭环主要扩展“下一批训练数据从哪里来”。

它们可以组合,但没有一个组件会自动补齐其他接口。

世界模型

根据当前状态与动作预测未来状态、占用、视频或隐变量。

VLM / LLM

把视觉场景、语言指令、解释和高层推理放进共享 token 空间。

数据闭环

发现失败、选数据、标注或生成,再训练并做回归测试。

1. 世界模型:学一个可查询的未来

在强化学习语言里,环境有转移规律 P(sₜ₊₁ | sₜ, aₜ)。世界模型用参数模型近似这个规律:

zₜ = encoder(observation history) ẑₜ₊₁ ~ world_model(zₜ, actionₜ) observation̂ₜ₊₁ = decoder(ẑₜ₊₁) # optional

z 可以是视频 token、BEV、occupancy、目标状态或纯隐变量。模型可能预测一帧,也可能 rollout 数秒。若未来有多种可能,模型需要表达分布,而不是只输出平均画面。

世界模型至少有四种用途

表征预训练

通过预测未来学习运动、几何和遮挡规律,再把表示交给驾驶策略。

数据生成

给定天气、路线或动作生成场景,用于补充训练和测试样本。

规划评估

对多个候选动作 rollout,比较未来碰撞、进度或规则风险。

策略训练

在低成本隐空间中做大量 imagined rollout,减少真实仿真调用。

能生成逼真视频,不等于动作条件正确。一个世界模型可以画出漂亮未来,却在“向左打方向”时生成错误车辆运动。驾驶更关心 action controllability、几何一致性和长时因果,而不只关心画面观感。

2. 三类代表工作解决的不是同一问题

GAIA-1:视频、文本和动作的生成式模型

GAIA-1 把视频、文本与动作映射成离散 token,再预测序列中的下一个 token。它可以按自车行为和场景描述生成驾驶视频,用途偏向场景建模、表示学习与可控生成。

Vista:不同粒度的动作条件

Vista 接受从高层命令和目标点,到轨迹、转角和速度的多种控制。这个设计直接触及世界模型的一个核心测试:控制条件变化时,未来是否按照正确车辆行为变化。

Think2Drive:在隐世界里训练 RL 规划器

Think2Drive 学习低维世界动态,让它作为 neural simulator,在模型内部训练强化学习规划器。它关注样本效率和 corner case 策略,不以生成高保真视频作为主要目标。

路线模型输出主要用途最该检查
生成式视频世界模型未来视频或 token生成、预训练、场景编辑动作可控性、几何、长时一致
BEV / occupancy 世界模型未来空间状态预测、规划、风险评估动态参与者、多模态未来、校准
隐空间 dynamics下一隐状态与奖励model-based RL模型偏差、imagined rollout 稳定性

“world model”是功能标签,不是统一架构。读论文先问它预测什么世界、由什么动作控制,以及下游拿预测做什么。

3. VLM 可以进入驾驶系统的五个位置

Vision-language model 把图像与文本映射到可交互的表示。驾驶领域使用它,不一定是让语言模型直接控制方向盘。

语言指令

理解“前方学校区域慢行”“在便利店后右转”等比固定 route command 更细的任务。

场景问答

回答危险对象、让行关系和预期动作,形成可读的中间监督。

高层决策

输出行为 token,例如等待、并线、绕行,再交给低层轨迹规划器。

数据标注

为驾驶片段生成事件描述、问答或难例标签,帮助检索和训练。

解释接口

把感知与规划状态变成人能审阅的原因说明,但解释必须与真实决策连接。

DriveLM:把推理拆成图结构问答

DriveLM 使用 Graph VQA,把感知、预测和规划问题组织成图:先定位相关对象,再问它们如何交互,最后连接到驾驶决策。它提供了可读监督和零样本对象研究入口。

LMDrive:语言作为闭环驾驶条件

LMDrive 融合多模态传感器和自然语言指令,并在 CARLA 做闭环实验。它把语言从离线解释扩展为策略条件。

看到“LLM driver”时问:语言模型输出的是文字解释、行为决策、轨迹还是底层控制?推理延迟、数值几何和闭环失败由哪个部件负责?

4. 语言推理不自动等于可靠驾驶推理

VLM 擅长开放词汇语义和自然语言交互,但驾驶还需要连续几何、毫秒级时序、概率校准和车辆可行性。几个风险要分开看:

风险表现需要的约束或评测
视觉幻觉描述不存在的车辆、灯态或标志与检测和地图证据绑定,测 object grounding
几何含糊知道“要避让”,却不给可行距离和时序连接 BEV、occupancy 和轨迹规划器
解释脱节文字理由合理,实际动作由另一捷径决定干预解释变量,检查决策是否随之改变
延迟不稳定长文本推理赶不上控制周期异步高层决策、固定低层安全回路
开放输出同一场景生成不一致文本或动作结构化输出、约束解码、重复运行统计

一种常见边界是:VLM 负责低频语义和高层行为,专用模型负责高频感知、轨迹与控制。它仍可联合训练,但责任接口清楚。

5. 数据闭环:模型失败决定下一批训练数据

模型规模扩大后,瓶颈常从“能否训练”转到“下一批应该训练什么”。数据闭环是一条持续工程过程:

运行与评测fleet · logs · simulation
失败发现events · uncertainty · disagreement
选择与标注human · auto · synthetic
训练与回归new model · old cases

新模型再次运行,闭环重新开始。关键不是保存所有日志,而是发现哪些样本能改变决策边界。

失败发现的信号

  • 安全员接管、规则触发、急刹和碰撞余量过小;
  • 多个模型或传感器对同一场景意见不一致;
  • 预测分布不确定性高,或输入远离训练表示;
  • 特定场景切片持续落后,例如雨夜无保护左转。

只按“不确定性最高”采样,可能反复收集传感器噪声;只按接管采样,又会漏掉人类没注意到的近失事件。需要把行为风险、场景覆盖和标注成本组合起来。

回归测试比新分数同样重要

新增施工场景数据后,模型可能改善绕行,却让常规跟车变差。每次训练都要在固定安全场景集、近期失败集和未见分布上回归。数据闭环不是单向追逐新难例,它要守住已经学会的能力。

6. 不确定性与安全约束不会自动消失

世界模型和 VLM 都可能输出流畅但错误的结果。驾驶系统需要知道“哪里不确定”,并把不确定性转成行为。

认识不确定

传感器遮挡、未见对象和模型分歧使预测分布变宽。输出多个未来只是在表达,不代表概率已校准。

采取保守动作

减速、扩大安全距离、请求接管或切换后备策略。保守策略仍要避免无限停车。

安全层可以检查可行驶区域、车辆动力学、碰撞和交通规则。它可能不可微,也可能在学习模型之外。端到端联合学习与显式安全边界可以共存。

7. 今后读新论文,用这张审查表

问题你要找的具体答案常见模糊写法
任务输入、输出、驾驶范围与时间尺度“通用自动驾驶模型”
表示坐标系、时间记忆、显式与隐式结构“统一 token 表示”
训练数据来源、专家、损失、特权信息“大规模多模态训练”
闭环动作是否改变未来,他车是否反应“simulation-based metric”
比较相同数据、传感器、版本和算力“显著超过已有方法”
消融每个新组件的独立贡献与成本只和小基线比最终分数
失败按场景切片的碰撞、违规和退化只报平均值和成功视频
边界论文证据没有覆盖的部署条件从单基准推到普遍安全

30 秒摘要法

读完摘要后尝试填一句:

“它用 输入 形成 表示,输出 决策;通过 训练信号 学习,在 评测协议 中改善 指标。目前还不能证明 证据边界外的主张。”

填不出的空格,就是继续阅读的顺序。

即时检查

题 1 · 世界模型最核心的条件是什么?

题 2 · 逼真视频为什么不够?

题 3 · VLM 最适合首先承担哪类接口?

题 4 · 数据闭环的起点是什么?

结课练习:审一段论文摘要

虚构摘要:

“我们提出 DriveEverything,一个由 7B VLM 和视频世界模型组成的统一驾驶模型。系统根据六路相机和文本导航生成未来视频与自车轨迹。在 nuScenes 上,轨迹 ADE 比 UniAD 低 12%,问答准确率提高 8%。这些结果说明系统已具备可靠的开放世界驾驶能力。”

请写 250–400 字:

  1. 用五问框架复述它已经说清的部分。
  2. 世界模型与 VLM 分别承担什么可能角色?摘要没有说清什么接口?
  3. 两个离线指标能支持哪些结论,不能支持哪些结论?
  4. 列出三个必须补的实验,其中至少一个是闭环实验,一个是组件消融。

把答案发给我,我会按研究审稿的方式给反馈。这也是判断你是否已经获得“整体地图”的最好证据。

全课压缩成一张地图

  1. 系统边界:端到端的两个端可能是传感器到控制,也可能是传感器到运动规划。
  2. 表示接口:透视特征、BEV、目标向量、occupancy 和隐变量各有信息偏好。
  3. 学习信号:行为克隆实用,却受分布偏移和因果混淆影响;RL 常通过教师或世界模型加入。
  4. 架构演化:现代方法重新加入结构,让检测、地图、预测和规划围绕最终任务联合学习。
  5. 评测证据:open-loop 与 closed-loop 回答不同问题,分数必须连同数据和协议一起读。
  6. 新方向:世界模型、VLM 和数据闭环改变了不同接口,不会自动替代几何、控制与安全验证。

到这里,OpenDriveLab 仓库里的 BEV、multi-sensor fusion、causal confusion、world model、VLM、interpretability 和 robustness 已经不再是平铺分类。它们都能放回同一条驾驶闭环。

首选资料与选读

  1. 首选:GAIA-1读摘要,找出输入 token、预测目标和控制条件。
  2. Vista比较 command、goal point、trajectory、angle 和 speed 五种控制粒度。
  3. Think2Drive关注世界模型为什么可以成为训练规划器的 neural simulator。
  4. DriveLM检查 Graph VQA 如何连接 perception、prediction 与 planning。
  5. LMDrive区分语言指令、传感器融合和闭环控制各自的接口。