没见过
传感器或场景超出训练分布,例如特殊车辆、施工改道或强眩光。
Lesson 03 · Learning signal
驾驶数据记录了专家做过什么,却不一定告诉模型偏离以后怎么办。序列决策的麻烦,从模型第一次犯错后才真正开始。
| 方法 | 监督从哪里来 | 策略访问什么状态 | 自动驾驶中的典型用途 |
|---|---|---|---|
| 行为克隆 BC | 固定专家动作或轨迹 | 主要是专家访问过的状态 | 从行车日志直接训练策略 |
| 交互式模仿 | 专家对当前策略状态的标签 | 策略自己访问的状态 | 补充偏离恢复与失败场景 |
| 强化学习 RL | 奖励与环境转移 | 策略探索得到的状态 | 在仿真中学习教师或规划器 |
| 辅助监督 | 目标、地图、深度、occupancy 等标签 | 取决于主数据来源 | 给共享表示加入结构 |
端到端与这四种训练方式是两个维度。一个传感器到轨迹的模型可以用行为克隆,也可以模仿 RL 教师;一个 RL 策略也可能只控制模块化规划器中的一小段。
Behavioral cloning 收集专家驾驶数据 (observation, action),训练策略预测专家动作。若输出是轨迹,就比较预测轨迹和专家轨迹。
它的优点很实际:真实车每天能积累大量日志,不需要在线试错;训练可以离线完成;常规驾驶包含丰富的视觉和交通上下文。
但专家日志偏向“正确状态”。人类驾驶员通常保持在车道中央,很少带着 30 厘米横向偏差、错误转角和惊慌制动继续开。模型在部署时一旦偏离,就进入训练集很少出现的状态。
监督学习常假设训练样本与测试样本来自相似分布。驾驶不满足这个条件:动作会改变下一次观测。策略自己的错误会制造新的测试分布,这叫 covariate shift;小错误经多步反馈放大,叫 compounding error。
DAgger 的核心不是一个特殊网络,而是数据收集循环:
它直接针对分布偏移,因为监督数据开始覆盖策略会犯错的区域。真实道路上,让不成熟策略自由探索有安全风险,所以工程中常用仿真、封闭场地、影子模式、人工接管日志或合成偏移近似这个循环。
训练数据可以故意加入相机位置偏移、轨迹扰动或历史动作噪声,再要求策略恢复到正确路线。它让模型看见“偏了以后怎么回去”。但合成扰动若不符合车辆动力学,也会教出不真实的恢复动作。
Causal Confusion in Imitation Learning 指出,行为克隆是判别式监督学习,本身不知道专家、动作和环境之间的因果结构。模型会选择最容易降低训练误差的相关信号,即使部署时这个信号不应决定动作。
假设训练输入包含自车当前速度和专家的制动状态。日志里“正在制动”与“下一时刻减速”高度相关。模型可能学会:看到刹车已经踩下,继续预测制动;看到刹车没踩,继续不制动。
部署时,策略必须先决定是否踩刹车。把自身上一动作当作原因,会产生惯性循环:该开始制动时没有制动信号,该松开时又因历史制动继续刹。训练相关性没有告诉模型“前方障碍导致专家踩刹车”。
更多输入不保证更好。如果额外信号是专家动作的后果、数据收集过程的痕迹或测试时不可用的信息,模型可能走捷径。
解决办法不是只删一个字段。需要通过干预打破错误相关性:在同样场景下改变动作、收集偏离状态、查询专家,或用因果上更合理的表示和训练任务。
你已有的 RL 直觉可以直接套用:
RL 的吸引力在于目标可以跨时间:为了几秒后安全并线,当前可能需要减速让行。策略通过 rollout 看到动作如何改变未来状态,不局限于逐帧模仿。
真实道路却不适合大规模探索。碰撞不能拿来反复试;稀有场景样本效率低;奖励权重容易产生投机行为。例如进度奖励过大,策略可能冒险穿过缝隙;碰撞惩罚过大,策略可能永远停车。
Learning by Cheating 先训练一个能读取场景真值和所有交通参与者位置的 privileged teacher,再训练只看相机的学生模仿教师。教师在部署时不存在,它的作用是生成稳定监督。
Roach 进一步用强化学习训练读取 BEV 特权信息的专家,再让单目端到端学生模仿。这里 RL 负责在仿真中学习较好的交互策略,模仿学习负责把策略转移到真实部署可用的视觉输入。
所以“用 RL”并不一定表示最终车上的策略直接通过 RL 训练。RL 也可以只存在于教师、数据生成或世界模型内的规划阶段。
只有转向或轨迹监督时,一个场景被压成很少的输出数字。辅助任务要求共享表示同时支持目标检测、深度、车道、occupancy 或交通灯状态,减少网络依赖偶然纹理的空间。
但辅助任务不是越多越好。任务标签可能昂贵;不同损失尺度会争夺表示;一个对检测有利的特征不一定对规划有利。现代 planning-oriented 方法强调最终规划目标,而不是让所有任务平均用力。
| 数据来源 | 擅长覆盖 | 常见盲点 | 补救方式 |
|---|---|---|---|
| 人类常规日志 | 真实视觉与正常交通 | 偏离恢复、危险长尾 | 事件挖掘、接管数据、合成扰动 |
| 规则专家仿真 | 可控场景和大量标签 | 规则上限、视觉域差异 | 更强教师、域随机化、真实微调 |
| RL 专家仿真 | 交互策略和 on-policy 状态 | 奖励投机、仿真偏差 | 多指标审计、真实日志验证 |
| 生成式数据 | 场景组合和稀有条件 | 物理错误、频率失真 | 真实数据校准、自动规则检查 |
传感器或场景超出训练分布,例如特殊车辆、施工改道或强眩光。
训练集只有专家状态,没有策略偏离后的恢复监督。
模型用动作后果、地图偏差或数据采集痕迹预测专家动作。
损失或奖励允许策略通过停车、贴线或冒险获得较高分。
这四类问题需要不同修复。单纯加模型参数,无法替代状态覆盖、因果干预和目标审计。
一辆行为克隆车辆在直路表现正常。遇到侧风后,它向右偏 20 厘米,随后转向开始左右振荡,最终压线。训练数据来自熟练司机的正常道路日志。
请写出:
把答案发给我,可以根据你的 RL 基础进一步讨论 on-policy distribution 和 reward hacking。