<p>Driving interaction data are important for training and evaluating autonomous driving Vision-Language-Action (VLA) models, but existing datasets contain limited dense interaction samples and weak alignment between trajectories, visual inputs, and language annotations. This work presents the Interactive Enhanced Driving Dataset (IEDD), a large-scale interaction-oriented dataset constructed from five naturalistic trajectory datasets: Lyft Level 5, Waymo, nuPlan, INTERACTION, and SIND. IEDD contains 7.31 million ego-centric interaction segments, including 6.66 million multi agents cases, covering head-on, car-following, merging, and crossing interactions. Each segment is associated with trajectory-derived interaction metrics describing interaction intensity and efficiency. Based on these annotations, IEDD-VQA further provides trajectory-reconstructed BEV videos, structured interaction semantics, and multi-turn question-answer pairs. The dataset can support interaction mining, long-tail scenario analysis, VLA instruction tuning, and hierarchical evaluation of perception, behavior description, physical quantification, and counterfactual reasoning.</p>

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

An interactive enhanced driving dataset for autonomous driving

  • Haojie Feng,
  • Xinrui Zhang,
  • Mengjie Tian,
  • Peizhi Zhang,
  • Zhuoren Li,
  • Junpeng Huang,
  • Xiurong Wang,
  • Junfan Zhu,
  • Jianzhou Wang,
  • Dongxiao Yin,
  • Lu Xiong

摘要

Driving interaction data are important for training and evaluating autonomous driving Vision-Language-Action (VLA) models, but existing datasets contain limited dense interaction samples and weak alignment between trajectories, visual inputs, and language annotations. This work presents the Interactive Enhanced Driving Dataset (IEDD), a large-scale interaction-oriented dataset constructed from five naturalistic trajectory datasets: Lyft Level 5, Waymo, nuPlan, INTERACTION, and SIND. IEDD contains 7.31 million ego-centric interaction segments, including 6.66 million multi agents cases, covering head-on, car-following, merging, and crossing interactions. Each segment is associated with trajectory-derived interaction metrics describing interaction intensity and efficiency. Based on these annotations, IEDD-VQA further provides trajectory-reconstructed BEV videos, structured interaction semantics, and multi-turn question-answer pairs. The dataset can support interaction mining, long-tail scenario analysis, VLA instruction tuning, and hierarchical evaluation of perception, behavior description, physical quantification, and counterfactual reasoning.