世界模型
根据当前状态与动作预测未来状态、占用、视频或隐变量。
Lesson 06 · Models beyond the policy
世界模型预测“如果这样做会发生什么”,VLM 处理语言与语义关系,数据闭环决定系统下一轮学什么。它们解决的是不同接口。
端到端驾驶仍要处理五个问题:看什么、保留什么表示、输出什么、怎样学习、怎样评测。世界模型主要扩展“未来如何变化”,VLM 主要扩展“语义和语言怎样进入系统”,数据闭环主要扩展“下一批训练数据从哪里来”。
它们可以组合,但没有一个组件会自动补齐其他接口。
根据当前状态与动作预测未来状态、占用、视频或隐变量。
把视觉场景、语言指令、解释和高层推理放进共享 token 空间。
发现失败、选数据、标注或生成,再训练并做回归测试。
在强化学习语言里,环境有转移规律 P(sₜ₊₁ | sₜ, aₜ)。世界模型用参数模型近似这个规律:
z 可以是视频 token、BEV、occupancy、目标状态或纯隐变量。模型可能预测一帧,也可能 rollout 数秒。若未来有多种可能,模型需要表达分布,而不是只输出平均画面。
通过预测未来学习运动、几何和遮挡规律,再把表示交给驾驶策略。
给定天气、路线或动作生成场景,用于补充训练和测试样本。
对多个候选动作 rollout,比较未来碰撞、进度或规则风险。
在低成本隐空间中做大量 imagined rollout,减少真实仿真调用。
能生成逼真视频,不等于动作条件正确。一个世界模型可以画出漂亮未来,却在“向左打方向”时生成错误车辆运动。驾驶更关心 action controllability、几何一致性和长时因果,而不只关心画面观感。
GAIA-1 把视频、文本与动作映射成离散 token,再预测序列中的下一个 token。它可以按自车行为和场景描述生成驾驶视频,用途偏向场景建模、表示学习与可控生成。
Vista 接受从高层命令和目标点,到轨迹、转角和速度的多种控制。这个设计直接触及世界模型的一个核心测试:控制条件变化时,未来是否按照正确车辆行为变化。
Think2Drive 学习低维世界动态,让它作为 neural simulator,在模型内部训练强化学习规划器。它关注样本效率和 corner case 策略,不以生成高保真视频作为主要目标。
| 路线 | 模型输出 | 主要用途 | 最该检查 |
|---|---|---|---|
| 生成式视频世界模型 | 未来视频或 token | 生成、预训练、场景编辑 | 动作可控性、几何、长时一致 |
| BEV / occupancy 世界模型 | 未来空间状态 | 预测、规划、风险评估 | 动态参与者、多模态未来、校准 |
| 隐空间 dynamics | 下一隐状态与奖励 | model-based RL | 模型偏差、imagined rollout 稳定性 |
“world model”是功能标签,不是统一架构。读论文先问它预测什么世界、由什么动作控制,以及下游拿预测做什么。
Vision-language model 把图像与文本映射到可交互的表示。驾驶领域使用它,不一定是让语言模型直接控制方向盘。
理解“前方学校区域慢行”“在便利店后右转”等比固定 route command 更细的任务。
回答危险对象、让行关系和预期动作,形成可读的中间监督。
输出行为 token,例如等待、并线、绕行,再交给低层轨迹规划器。
为驾驶片段生成事件描述、问答或难例标签,帮助检索和训练。
把感知与规划状态变成人能审阅的原因说明,但解释必须与真实决策连接。
DriveLM 使用 Graph VQA,把感知、预测和规划问题组织成图:先定位相关对象,再问它们如何交互,最后连接到驾驶决策。它提供了可读监督和零样本对象研究入口。
LMDrive 融合多模态传感器和自然语言指令,并在 CARLA 做闭环实验。它把语言从离线解释扩展为策略条件。
看到“LLM driver”时问:语言模型输出的是文字解释、行为决策、轨迹还是底层控制?推理延迟、数值几何和闭环失败由哪个部件负责?
VLM 擅长开放词汇语义和自然语言交互,但驾驶还需要连续几何、毫秒级时序、概率校准和车辆可行性。几个风险要分开看:
| 风险 | 表现 | 需要的约束或评测 |
|---|---|---|
| 视觉幻觉 | 描述不存在的车辆、灯态或标志 | 与检测和地图证据绑定,测 object grounding |
| 几何含糊 | 知道“要避让”,却不给可行距离和时序 | 连接 BEV、occupancy 和轨迹规划器 |
| 解释脱节 | 文字理由合理,实际动作由另一捷径决定 | 干预解释变量,检查决策是否随之改变 |
| 延迟不稳定 | 长文本推理赶不上控制周期 | 异步高层决策、固定低层安全回路 |
| 开放输出 | 同一场景生成不一致文本或动作 | 结构化输出、约束解码、重复运行统计 |
一种常见边界是:VLM 负责低频语义和高层行为,专用模型负责高频感知、轨迹与控制。它仍可联合训练,但责任接口清楚。
模型规模扩大后,瓶颈常从“能否训练”转到“下一批应该训练什么”。数据闭环是一条持续工程过程:
新模型再次运行,闭环重新开始。关键不是保存所有日志,而是发现哪些样本能改变决策边界。
只按“不确定性最高”采样,可能反复收集传感器噪声;只按接管采样,又会漏掉人类没注意到的近失事件。需要把行为风险、场景覆盖和标注成本组合起来。
新增施工场景数据后,模型可能改善绕行,却让常规跟车变差。每次训练都要在固定安全场景集、近期失败集和未见分布上回归。数据闭环不是单向追逐新难例,它要守住已经学会的能力。
世界模型和 VLM 都可能输出流畅但错误的结果。驾驶系统需要知道“哪里不确定”,并把不确定性转成行为。
传感器遮挡、未见对象和模型分歧使预测分布变宽。输出多个未来只是在表达,不代表概率已校准。
减速、扩大安全距离、请求接管或切换后备策略。保守策略仍要避免无限停车。
安全层可以检查可行驶区域、车辆动力学、碰撞和交通规则。它可能不可微,也可能在学习模型之外。端到端联合学习与显式安全边界可以共存。
| 问题 | 你要找的具体答案 | 常见模糊写法 |
|---|---|---|
| 任务 | 输入、输出、驾驶范围与时间尺度 | “通用自动驾驶模型” |
| 表示 | 坐标系、时间记忆、显式与隐式结构 | “统一 token 表示” |
| 训练 | 数据来源、专家、损失、特权信息 | “大规模多模态训练” |
| 闭环 | 动作是否改变未来,他车是否反应 | “simulation-based metric” |
| 比较 | 相同数据、传感器、版本和算力 | “显著超过已有方法” |
| 消融 | 每个新组件的独立贡献与成本 | 只和小基线比最终分数 |
| 失败 | 按场景切片的碰撞、违规和退化 | 只报平均值和成功视频 |
| 边界 | 论文证据没有覆盖的部署条件 | 从单基准推到普遍安全 |
读完摘要后尝试填一句:
“它用 输入 形成 表示,输出 决策;通过 训练信号 学习,在 评测协议 中改善 指标。目前还不能证明 证据边界外的主张。”
填不出的空格,就是继续阅读的顺序。
虚构摘要:
“我们提出 DriveEverything,一个由 7B VLM 和视频世界模型组成的统一驾驶模型。系统根据六路相机和文本导航生成未来视频与自车轨迹。在 nuScenes 上,轨迹 ADE 比 UniAD 低 12%,问答准确率提高 8%。这些结果说明系统已具备可靠的开放世界驾驶能力。”
请写 250–400 字:
把答案发给我,我会按研究审稿的方式给反馈。这也是判断你是否已经获得“整体地图”的最好证据。
到这里,OpenDriveLab 仓库里的 BEV、multi-sensor fusion、causal confusion、world model、VLM、interpretability 和 robustness 已经不再是平铺分类。它们都能放回同一条驾驶闭环。