Personal Knowledge Base

A long-term research and learning notebook for posts, notes, papers, projects, and research directions.

Skip to content
Back to papers
Autonomous DrivingarXiv2026published

AccidentSim:从真实事故报告生成具有物理真实性的车辆碰撞视频

AccidentSim 从 NHTSA/NMVCCS 真实事故报告提取物理线索,在 CARLA 中重建碰撞仿真,再以仿真轨迹 LoRA 微调 Llama 得到 AccidentLLM,由事故文本直接预测物理一致的碰撞后轨迹,最终通过前景—背景合成生成可控视角的碰撞视频。

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai21 min read

论文:Xiangwen Zhang et al., AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports 链接:arXiv:2503.20654 | DOI: 10.48550/arXiv.2503.20654

概述

AccidentSim 面向自动驾驶中罕见但关键的碰撞场景数据不足问题,提出了一套由真实事故报告、物理仿真和大语言模型共同驱动的视频生成框架。其关键思路不是让视频生成模型直接"想象"碰撞,而是先从 NHTSA/NMVCCS 事故报告提取速度、碰撞类型、道路条件等信息,在 CARLA 中重建并仿真碰撞;再以仿真得到的碰撞后轨迹微调 Llama,得到能够由事故文本直接预测物理一致后碰撞轨迹的 AccidentLLM。最终,系统将完整的车辆轨迹与可渲染背景合成,生成可控视角的碰撞视频。论文报告称,该方法在轨迹误差、物理真实性、文本语义一致性以及用于训练自动驾驶策略后的碰撞率方面优于比较方法。(Zhang 等, 2026)

1. 介绍

问题背景:自动驾驶的"稀有事件困境"

主流自动驾驶数据集,如 KITTI、nuScenes、Waymo 和 BDD100K,主要由正常行驶数据构成;真实碰撞事件因发生频率低、采集危险且成本高,很难覆盖。论文将此视为自动驾驶中的 Curse of Rarity(稀有性诅咒):模型缺少安全关键事件的训练样本,因而难以在真正危险的边界条件下作出可靠反应。

近年来的视频生成模型可以生成视觉上较自然的驾驶画面,但直接生成碰撞时通常存在以下问题:

  • 碰撞后的动力学不可信:车辆可能出现不符合动量、冲量、摩擦和质量分布规律的运动;
  • 文本控制不足:难以同时准确满足事故类型、车辆状态、道路环境和镜头视角等条件;
  • 端到端物理仿真代价高:仿真器需要充分指定参数,难以直接响应自然语言中不完整的事故描述。

核心思路

AccidentSim 将"物理仿真"作为高质量数据的生成器,而非在线视频生成时的必要环节:

事故报告 → 物理线索提取 → CARLA 碰撞仿真 → 轨迹数据集 → AccidentLLM → 轨迹驱动的视频合成

这样,AccidentLLM 相当于蒸馏了仿真器中的碰撞动力学知识:推理阶段可以直接由用户描述预测碰撞后轨迹,从而避免每次都进行昂贵的在线物理仿真。

主要贡献

论文的贡献可以概括为三点:

  1. 提出 AccidentSim:利用真实事故报告中的物理线索和上下文信息,生成包含物理合理碰撞运动的视频;
  2. 提出 AccidentLLM:以仿真轨迹微调 Llama,用于从文本条件预测新颖且物理一致的碰撞后轨迹;
  3. 验证了系统对多种道路类型、碰撞类型和车辆数量的泛化能力,并评估其对自动驾驶策略安全性的提升效果。(Zhang 等, 2026)

2. 相关工作

2.1 安全关键场景与事故数据集

已有事故数据集,如 CADP、ISSAFE、CCD 等,提供了真实事故视频或标注,但受限于采集成本、视角固定和场景规模。另一类工作通过对抗生成、轨迹优化或强化学习构造危险场景,例如 AdvSim、Learning-to-Collide 和 STRIVE。

这些方法的共同局限是:多数重点在于碰撞前的高风险行为生成或避碰测试,较少建模车辆真正接触之后的碰撞动力学与运动轨迹。AccidentSim 的定位是补齐"碰撞发生—碰撞后运动"这一阶段。

2.2 语言条件下的交通生成与轨迹预测

语言条件交通生成方法,如 LCTGen、CTG++、TrafficGen 和 Trajectory-LLM,可以根据自然语言控制交通参与者的行为。传统轨迹预测模型则通常依赖历史轨迹、高清地图和多智能体交互建模。

AccidentSim 与这些工作的差异在于:

  • 输入不仅描述常规交通意图,也包含碰撞相关的语义和物理条件;
  • 输出重点是碰撞后轨迹,而不是普通驾驶预测;
  • 训练监督来自 CARLA 中按真实事故报告重建的物理仿真结果。

2.3 物理仿真与碰撞建模

传统车辆碰撞模型基于动量守恒、恢复系数、摩擦力等解析规律;CARLA、LGSVL 等现代仿真器可更完整地模拟道路、车辆和动力学交互。

但仿真器也存在不足:

  • 参数设定繁琐;
  • 计算成本较高;
  • 对不完整的自然语言描述不够灵活。

因此,AccidentSim 采用"离线仿真生成数据 + 在线 LLM 预测轨迹"的折中方式,试图同时获得物理约束与文本生成效率。

2.4 驾驶视频与世界模型生成

Kling、Gen-4、Jimeng、Cosmos 等通用或驾驶视频模型已经具备一定的视觉生成能力;DriveDreamer、Panacea、MagicDrive 等方法则强调布局、3D 几何、多视角或道路结构控制。

论文认为,视觉逼真并不等于物理可信。AccidentSim 将碰撞轨迹作为视频合成的先验控制信号,试图避免纯视频模型在碰撞后"车辆乱飞、穿模或速度变化失真"等问题。

3. 模型框架

AccidentSim 包含两条相互关联的流程:

  1. 离线数据构建与模型训练:从真实事故报告重建碰撞仿真场景,训练 AccidentLLM;
  2. 在线事故视频生成:从用户事故描述生成碰撞前轨迹、碰撞后轨迹与视频画面。

3.1 事故报告信息提取与碰撞仿真

论文从 NMVCCS 事故报告中抽取三类信息:

阶段提取内容示例
碰撞前道路环境、道路类型、天气、驾驶行为、车辆位置和速度
碰撞中撞击类型、车辆相对位置、碰撞角度、碰撞时状态
碰撞后车辆最终状态、紧急响应等事故结果信息

作者采用带 few-shot 提示的 Llama 而非固定模板来提取信息,理由是事故报告的自然语言形式高度多样。

随后,系统将道路信息交由 RoadRunner 构建三维道路模型,导入 CARLA;车辆速度、位置、方向以及摩擦、重力等参数用于重放碰撞过程。仿真记录车辆在撞击后的位姿序列,形成轨迹数据集。

3.2 AccidentLLM:碰撞后轨迹预测

AccidentLLM 基于 Llama,经 LoRA 进行监督微调。模型输入是由用户事故描述或碰撞前规划得到的碰撞信息,例如:

  • 车辆数量和车型;
  • 车辆速度、位置、朝向;
  • 道路类型;
  • 碰撞类型与碰撞点;
  • 撞击瞬间的运动状态。

输出则是每辆车的碰撞后时序轨迹,包括三维位置和旋转状态。

训练采用 L1L_1 轨迹匹配损失:

Ltraj=1Ni=1N(p^ipi+θ^iθi),\mathcal{L}_{\text{traj}} = \frac{1}{N} \sum_{i=1}^{N} \left( \|\hat{p}_i - p_i^{*}\| + \|\hat{\theta}_i - \theta_i^{*}\| \right),

其中:

  • p^i\hat{p}_ipip_i^{*} 分别是预测位置和仿真真值位置;
  • θ^i\hat{\theta}_iθi\theta_i^{*} 分别是预测姿态和真值姿态;
  • NN 为轨迹时间步数。

该目标使模型同时拟合平移与旋转运动。需要注意的是,论文中的"物理一致性"主要指与 CARLA 仿真轨迹的一致性,以及基于冲量和动量变化误差的评估;它并不等同于对真实世界每一种车辆结构变形和复杂接触现象的完整验证。

3.3 碰撞前轨迹规划

事故描述通常不能直接给出完整碰撞轨迹,因此论文为碰撞前过程设计了三阶段规划:

  1. 初始状态提取:得到碰撞点、车辆数量、速度、距离、加速度和朝向等;
  2. 车道与路径选择:依据地图、车辆方向和碰撞约束筛选可行车道组合;
  3. 轨迹生成与验证:生成通向碰撞点的候选轨迹,并根据碰撞条件筛选最终可行轨迹。

其作用是生成合理的事故发生前运动,并将撞击瞬间的状态传递给 AccidentLLM。

3.4 视频生成与合成

视频生成不依赖端到端视频扩散,而是采用前景、背景分离的可控合成路线:

  • 前景处理:沿完整轨迹渲染指定车型,得到车辆碰撞前景;
  • 背景处理:若无需切换视角,使用 Waymo 原始帧;若需要新视角,则基于 ChatSim 的场景重建方法渲染背景;
  • 视频合成:通过 alpha compositing 将车辆前景和背景融合。

这种设计有利于控制车辆外观、道路场景和相机视角,但也意味着最终画面的真实感仍取决于前景渲染、背景重建和融合质量。

4. 实验

4.1 数据与评估任务

论文使用两类数据:

  • Waymo Open Dataset:用于道路背景和驾驶场景;
  • NHTSA/NMVCCS 事故报告:用于构建事故仿真与训练数据。

实验围绕三项任务展开:

  1. 碰撞后轨迹的准确性与物理一致性;
  2. 生成视频的视觉质量、物理真实性和文本对齐程度;
  3. 使用生成碰撞视频训练自动驾驶策略后,对碰撞率的影响。

4.2 碰撞后轨迹质量

轨迹实验将 AccidentLLM 与 AutoVFX 比较,涵盖四类事故:

  • 直行障碍物碰撞;
  • 无保护左转;
  • 右转;
  • 变道。

评价指标包括:

  • 1 秒、2 秒和 3 秒预测时刻的轨迹 L2L_2 误差;
  • 冲量变化的 MAE / RMSE;
  • 动量变化的 MAE / RMSE。
场景AutoVFX 平均 L2L_2 误差(m)AccidentSim 平均 L2L_2 误差(m)
直行障碍物1.841.49
无保护左转1.421.73
右转2.040.94
变道2.001.28

AccidentSim 在直行障碍物、右转和变道场景下的平均轨迹误差较低,右转和变道的优势尤其明显;但在无保护左转场景中,表中结果反而是 AutoVFX 更低。这一点说明论文"整体领先"的结论并非对每种场景都成立。

物理一致性指标上,AccidentSim 在表中四类场景的冲量和动量误差均低于 AutoVFX。该结果支持模型更接近 CARLA 仿真产生的动力学轨迹,但评估真值也是模拟器输出,因此结论更准确的表述应是:模型较好地蒸馏了该仿真设置下的物理行为,而不是已经完全验证其现实世界碰撞物理精度。(Zhang 等, 2026)

4.3 文本—轨迹语义一致性

作者采用人工 A/B 测试,比较 AccidentSim、TrafficGen、MotionCLIP 和 LCTGen 在两类语言输入上的表现:

  • 完整事故报告;
  • 属性描述文本。

AccidentSim 的平均对齐评分为:

输入类型AccidentSim 分数(1–5)
事故报告4.49
属性描述4.46

与 LCTGen 的 3.93 和 4.10 相比,AccidentSim 的评分更高。论文将提升归因于:模型在仿真校准过的事故数据上训练,因此能够把事故叙述映射到更符合运动学逻辑的轨迹。

4.4 生成视频质量

视频评价包括三类指标:

  • VBench:运动平滑度、图像质量;
  • 人工评价:物理真实性、照片级真实感、语义一致性;
  • GPT-4o 评价:同样衡量物理真实性、照片级真实感和语义一致性。

与 Kling 2.0、Gen-4、Jimeng 3.0、Cosmos、AutoVFX 相比,AccidentSim 的主要结果如下:

指标AccidentSim结果解读
Motion Smoothness0.997表中最高
Imaging Quality0.718低于 Jimeng 3.0 的 0.727,但具有竞争力
人工 PhysReal3.906表中最高
人工 PhotoReal3.622低于 Jimeng 3.0 的 3.703
人工 Align4.186表中最高
GPT-4o PhysReal0.839表中最高
GPT-4o Align0.910表中最高

结果反映出该方法最突出的优势是物理真实性与文本语义对齐,而并非在所有纯视觉质量指标上绝对领先。也就是说,AccidentSim 的方法选择明显偏向"轨迹和物理可控性优先",并以一定的视觉生成自由度作为交换。

4.5 对自动驾驶碰撞率的影响

作者将 AccidentSim 生成的视频加入自动驾驶策略训练,并在双车、三车和多车事故场景中测试碰撞率。结果显示:

方法平均碰撞率
预微调策略(Pre Fine-tuning)0.552
Learning-to-Collide0.304
AdvSim0.320
CARLA Scenario Generator0.258
Adversarial Trajectory Optimization0.179
ChatScene0.112
AccidentSim0.073

按表中数据,AccidentSim 的平均碰撞率最低。相对于未加入其生成数据的预微调策略,碰撞率从 0.552 降至 0.073,绝对下降 0.479,约为 86.8% 的相对下降。

不过,这个结果应结合实验设置理解:策略训练和评估均建立在论文设定的仿真/基准环境中。它说明生成事故数据在该评估协议下具有训练价值,但不能直接推出对真实道路安全性的同等提升。

5. 总结与评价

AccidentSim 的核心价值在于将事故视频生成拆解为一个更可验证的链条:

真实事故报告提供语义和物理条件 → 仿真器提供动力学监督
→ LLM 提供从不完整文本条件到碰撞轨迹的快速泛化 → 渲染模块负责视频表达

相较于直接由视频生成模型生成碰撞,论文更强调"先确保轨迹可信,再渲染画面"的路线。这种设计特别适合自动驾驶中的安全关键数据增强任务,因为训练数据的价值不仅取决于画面是否逼真,也取决于车辆行为是否符合合理的运动学和动力学约束。

但该工作仍有几个值得关注的局限:

  1. 物理真实性依赖仿真器:AccidentLLM 学习的是 CARLA 及其参数设定下的碰撞规律,仿真与真实世界之间仍可能有域差异;
  2. 车辆形变建模不足:论文将车辆作为轨迹驱动的前景对象,作者也明确将车辆变形列为未来工作;
  3. 事故报告信息不完整:真实报告中的车重、碰撞接触面、路面状态等信息可能存在缺失或模糊,前端信息提取错误会向后传播;
  4. 视频合成而非端到端真实渲染:前景—背景合成提高了控制性,但遮挡、光照、阴影和碰撞损伤细节仍可能限制视觉真实性;
  5. 安全收益仍需现实验证:碰撞率下降来自特定仿真评估协议,尚不能替代真实道路或高保真闭环测试。

整体而言,AccidentSim 是一篇将事故报告理解、物理仿真、语言模型轨迹预测与可控视频合成结合得较完整的工作。它最重要的启发是:对于安全关键视频生成,物理仿真不一定要放在在线推理环节,也可以作为高质量监督来源,被蒸馏到高效生成模型中。

Related Posts