智算多多
官方邮箱:sw@zsdodo.com

公司地址:北京市丰台区南四环西路188号总部基地三区国联股份数字经济总部(邮 编:100070)


京公网安备11010602202532号 本篇将系统梳理支撑生成式自动驾驶研究的30余个关键数据集,从早期的KITTI到现代的nuScenes、Waymo,从单一模态到多模态融合,从真实道路采集到高保真仿真,全面解析各类数据集的技术特性、应用场景与构建挑战。无论您是从事感知算法开发、端到端规划研究,还是多模态大模型训练,本文都将为您提供详尽的数据选型指南。
单车感知数据集通常由单辆自动驾驶 📐 车辆(即 ego-vehicle,自车)采集,聚焦于目标检测、目标跟踪和场景理解等感知任务。这些数据集普遍配备多模态传感器(摄像头、激光雷达等)和三维标注,为端到端学习和需要真实数据分布的生成模型提供支撑。
数据集的发展反映了自动驾驶技术从二维图像分析向三维环境理解的跃迁。早期的KITTI和Cityscapes数据集作为先驱者,主要提供立体相机数据,用于二维和三维目标检测与分割任务。随着技术进步,更全面的数据集如nuScenes和Waymo Open Dataset涌现,集成了激光、雷达、毫米波雷达和多视角摄像头,配合高精地图(HD Map),支持三维目标检测、跟踪等复杂任务。
近期数据集如ONCE和PandaSet进一步推动了边界,提供了大规模数据量和多样化驾驶场景,尽管部分数据集在雷达或高精地图等传感器模态上有所缺失。这些数据集中高分辨率传感器和详细标注的引入,支持开发能够在多变环境中鲁棒运行的感知算法。
| 数据集 | 数据来源 | 采样频率 | 相机类型 | LiDAR | Radar | HD Map | 标注类型 |
|---|---|---|---|---|---|---|---|
| KITTI (2012) | 德国卡尔斯鲁厄 | 10 Hz | 立体相机(2个) | ✓ | - | - | 3D边界框 |
| Cityscapes (2016) | 德国50个城市 | N/A | 立体相机(2个) | - | - | - | 2D语义分割 |
| ApolloScape (2018) | 中国多个城市 | N/A | 立体相机(2个) | ✓ | ✓ | ✓ | 语义分割 |
| Honda H3D (2019) | 美国湾区 | N/A | 前视相机(1个) | ✓ | - | - | 3D边界框 |
| nuScenes (2019) | 波士顿、匹兹堡、新加坡 | 2 Hz | 环视相机(6个) | ✓ | ✓ | ✓ | 3D边界框 |
| Waymo Open Dataset (2019) | 美国多个城市 | 10 Hz | 前视/侧视(5个) | ✓ | ✓ | ✓ | 3D边界框 |
| Argoverse (2019) | 迈阿密、匹兹堡 | 10 Hz | 环视相机 | ✓ | ✓ | ✓ | 3D边界框 |
| PandaSet (2020) | 旧金山 | N/A | 环视相机(7个) | ✓ | - | - | 3D边界框、分割 |
| Audi A2D2 (2020) | 德国多个城市 | 10 Hz | 环视相机(6个) | ✓ | - | - | 3D边界框 |
| ONCE Dataset (2021) | 中国多个城市 | 10 Hz | 环视相机(7个) | ✓ | - | - | 3D边界框 |
传感器配置差异:早期数据集如KITTI依赖立体视觉,而现代数据集如nuScenes和Waymo采用环视相机阵列(6-7个),实现360°无死角感知。LiDAR方面,从KITTI的64线机械式LiDAR发展到现代的多层固态LiDAR,点云密度和精度显著提升。
标注精度改进:从简单的2D法到基于LSTM的深度学习模型(S-CNN),再到更复杂的深度学习模型(深度学习模型),
固态LiDAR,点云密度和精度显著提升。
标注粒度演进:从简单的3D边界框(KITTI)到精细的语义分割(Cityscapes、PandaSet),再到实例级标注和全景分割,标注质量的提升直接推动了生成式模型在细节重建方面的能力。
地理多样性:数据集覆盖从德国城市(KITTI、Cityscapes)到美国城市(Waymo、Honda H3D),再到亚洲场景(nuScenes的新加坡、ApolloScape的中国),这种多样性对训练泛化能力强的生成模型至关重要。
多智能体数据集捕捉多个道路使用者(车辆、行人等)随时间的行为,通常以轨迹或轨迹段的形式在共享场景中呈现。这些数据集支持轨迹预测、运动规划和交互仿真——这些正是生成式模型(如 CVAE、GAN Q、世界模型)活跃应用的领域,用于预测多样化的未来或生成真实驾驶场景。
许多数据集提供鸟瞰图(Bird's-Eye-View, BEV)轨迹配合高精地图,而非原始传感器数据,专注于行为层面的建模。
| 数据集 | 数据来源 | 采样频率 | 相机类型 | LiDAR | HD Map | 标注类型 |
|---|---|---|---|---|---|---|
| HighD (2018) | 德国高速公路 | N/A | 无人机(鸟瞰视角) | - | - | 智能体2D边界框 |
| INTERACTION (2019) | 美国、中国、欧盟路口 | 10 Hz | 无人机与固定相机 | - | ✓ | 智能体轨迹 |
| PIE (2019) | 加拿大多伦多 | 30 Hz | 前视相机 (1个) | - | - | 行人边界框、意图标签 |
| Argoverse 1 & 2 (2019, 2022) | 迈阿密、匹兹堡 | 10 Hz | 环视相机 | ✓ | ✓ | 智能体轨迹 |
| Lyft Level 5 (2020) | 美国帕洛阿尔托 | 10 Hz | 环视相机 | ✓ | ✓ | 智能体3D边界框 |
| rounD (2020) | 德国环岛 | N/A | 无人机(鸟瞰视角) | - | - | 车辆2D边界框 |
| Waymo Open Motion (2021) | 美国多个城市 | 10 Hz | 无 | - | - | 车辆、行人、骑行者轨迹 |
| nuPlan (2021) | 美国多个城市 | 10 Hz | 环视相机 | ✓ | ✓ | 智能体3D边界框 |
| LOKI (2021) | 日本路口 | 5 Hz | 车载相机 | ✓ | ✓ | 3D边界框、意图标签 |
| DAIR-V2X (2021) | 中国路口 | N/A | 车载与路侧相机 | - | ✓ | 3D边界框 |
| exiD (2022) | 德国高速出口 | N/A | 无人机(鸟瞰视角) | - | - | 车辆2D边界框 |
| V2X-Seq (2023) | 城市路口 | 10 Hz | 车载与路侧相机 | ✓ | ✓ | 3D智能体边界框 |
| V2V4Real (2023) | 美国俄亥俄州 | 10 Hz | 环视相机 | ✓ | - | 3D边界框 |
| NAVSIM (2024) | 美国多个城市 | 10 Hz | 环视相机 | ✓ | ✓ | 智能体3D边界框 |
| UniOcc (2025) | 美国多个城市 | 10 Hz | 环视相机 | ✓ | ✓ | 3D占用栅格 |
轨迹预测任务:Argoverse和Waymo Open Motion专注于短时程(3-5秒)和中长时程(5-8秒)轨迹预测,提供密集的交通参与者轨迹,适合训练基于CVAE或扩散模型的多模态轨迹生成器。
车路协同(V2X):DAIR-V2X和V2X-Seq是首批大规模V2X数据集,包含路侧单元(RSU)和车载传感器的同步数据,为研究生成式模型在协同感知和预测中的应用提供了独特资源。
环岛与复杂路口:rounD(德国环岛)和INTERACTION(多国路口)捕捉了复杂交互场景,如车辆让行、穿插和合并,这些数据对训练能够建模社会交互的生成模型(如Social GAN、Trajectron++)至关重要。
占用栅格预测:UniOcc作为最新数据集,提供了3D占用栅格标注,支持下一代基于占用空间的生成式世界模型(如OccWorld、OccSora)的训练。
通过视频游戏或仿真器(如CARLA)生成,提供完美标注的数据和可控的多样性。这些资源在数据合成和域适应中至关重要——例如,训练图像转换GAN或增强罕见场景(雨天、事故)的真实数据。
早期的合成数据主要依赖MATLAB和简单游戏引擎,如FRIDA/FRIDA2用于雾天图像生成。随着Unreal Engine和Unity等商业引擎的发展,SYNTHIA和Virtual KITTI提供了更真实的城市场景。现代趋势是基于CARLA仿真器构建大规模、多模态数据集,支持激光雷达仿真、多车协同和极端天气条件。
| 数据集 | 数据来源 | 相机类型 | LiDAR | HD Map | 仿真任务 |
|---|---|---|---|---|---|
| FRIDA/FRIDA2 (2010–2012) | MATLAB | 单目 | - | - | 雾天图像 |
| SYNTHIA (2016) | Unity | 多视角 | - | - | 雨天和雾天图像 |
| Virtual KITTI (2016 & 2019) | KITTI, Unity | 单目/立体 | - | - | 真实到仿真迁移 |
| Playing for Benchmarks (2018) | GTA-V游戏引擎 | 多视角 | - | ✓ | 交互式驾驶仿真 |
| Foggy Cityscapes (2018) | Cityscapes | 单目 | - | - | 雾天图像 |
| IDDA (2020) | CARLA仿真器 | 鱼眼相机 | - | - | 语义分割 |
| AIODrive (2021) | CARLA | 多视角 | ✓ | ✓ | 远距离点云 |
| OPV2V (2021) | CARLA | 多车视角 | ✓ | ✓ | 协同感知 |
| Shift (2022) | CARLA | 多视角 | ✓ | ✓ | 天气、光照仿真 |
| DeepAccident (2023) | CARLA | 多视角 | ✓ | ✓ | 事故场景仿真 |
| WARM-3D (2024) | CARLA | 单目 | ✓ | - | 仿真到真实迁移 |
罕见场景生成:通过程序化生成或物理引擎模拟,创建现实中难以采集的危险场景(如DeepAccident中的碰撞场景),用于生成式模型的条件训练。
多模态对齐:合成数据提供像素级精确的语义、深度和光流标注,支持训练能够生成一致多模态输出的生成模型。
2018年,BDD-X开创了自动驾驶语言标注数据集的先河。受近期大语言模型成功的启发,自2023年以来,多个新的多模态数据集被引入,将自然语言理解与自动驾驶感知相结合。这些数据集将视觉传感器数据(相机视角,通常还包括激光雷达或地图)与文本标注配对,范围涵盖问答(QA)对、自由格式字幕到指令式语句,专门为大语言模型或视觉问答任务设计。
现代语言标注数据集不仅提供简单的场景描述,更强调推理链(Chain-of-Thought)和多轮对话能力。例如,DriveLM引入了图结构视觉问答(Graph VQA),将感知、预测和规划任务通过问答形式串联;而NulInstruct则提供了跨17种任务类型的指令-响应对。
| 数据集 | 数据来源 | 模态 | QA类型 | QA对数量 |
|---|---|---|---|---|
| BDD-X (2018) | 行车记录仪录像 | 视频(40秒片段) | 自车意图、场景描述 | 7K |
| DRAMA (2023) | 日本驾驶视频 | 视频 | 风险目标、自车意图、自车动作、推理 | 170K |
| Rank2Tell (2024) | 美国驾驶视频 | 视频 | 目标重要性、自车意图、自车动作、推理 | 300K |
| LingoQA (2024) | 驾驶视频(4秒片段) | 视频 | 场景描述、建议动作、推理 | 419K |
| NuScenes-QA (2024) | nuScenes | 同nuScenes | 场景描述 | 460K |
| DriveLM (2024) | nuScenes, CARLA | 同nuScenes | 多步推理 | 360K |
| NuPlanQA (2025) | nuPlan | 同nuPlan | 感知、空间推理、自车意图 | 1M |
| NuInstruct (2024) | nuScenes | 同nuScenes | 跨17种任务类型的指令-响应对 | 91K |
| doScenes (2024) | nuScenes | 同nuScenes | 自由形式驾驶指令与场景参考点 | 4K |
| MAPLM (2024) | 中国城市 | 图像、LiDAR | 详细地图描述(车道、道路、标志) | 61K |
| NuScenes-MQA (2024) | nuScenes | 同nuScenes | 场景字幕、视觉QA | 1.5M |
| DriveBench (2025) | nuScenes | 同DriveLM | 视觉QA | 20K |
推理能力训练:DriveLM和NuPlanQA等数据集通过多步问答形式,训练模型进行链式思考(Chain-of-Thought),从感知("看到了什么")到预测("将会发生什么")再到规划("应该怎么做")。
指令跟随:NuInstruct提供了标准化的指令格式,支持训练能够接受人类自然语言指令(如"请在前方路口右转,注意避让行人")并生成相应驾驶动作的端到端模型。
风险评估:DRAMA和Rank2Tell专注于风险目标的识别与排序,训练模型理解场景中各参与者的危险程度,这对安全关键的生成式决策至关重要。
端到端驾驶:nuPlan(大规模专家驾驶数据)+ DriveLM(语言-视觉对齐)+ LingoQA(连续决策推理)。
合成数据增强:建议采用CARLA生态(OPV2V用于协同、DeepAccident用于安全关键场景、Shift用于域随机化)作为基础,配合生成式模型(如BEVGen、MagicDrive)进行风格迁移,实现仿真到真实的无缝过渡。
本章系统梳理了支撑生成式自动驾驶研究的四大类数据集:单车感知数据集奠定了三维环境理解的基础;多智能体数据集捕捉了复杂交通交互;合成与仿真数据集提供了可控的罕见场景;语言标注数据集则架起了视觉感知与自然语言推理的桥梁。这些数据资源不仅是当前算法训练的基石,更是生成式AI模型学习真实世界分布、创造逼真驾驶场景的根本来源。
值得注意的是,数据集的演进正从"大规模标注"向"高质量生成"转变。未来的自动驾驶系统可能不再完全依赖昂贵的人工采集与标注,而是结合真实数据与生成式模型(如GAIA-2、World Models)合成的混合数据,实现更高效、更安全、更具泛化性的学习。
专栏下篇预告:《生成式AI基础原理:从VAE到Diffusion——数学机制与算法架构深度解析》
敬请期待第3章的详细技术解读,我们将深入剖析变分自编码器、生成对抗网络、扩散模型、NeRF与3D高斯溅射的数学原理,揭秘这些生成式模型如何赋能自动驾驶的感知、预测与决策。我们将提供清晰的公式推导、架构对比图和直观的代码级解释,助您构建扎实的理论基础。
