极佳科技的自动驾驶场景生成模型drivedreamer和drivedreamer-2

原创 linger 黑客与作家 2024年09月19日 21:52 广东

drivedreamer

图片

图片

3种应用模式:

1、输入文本提示和交通约束结构化信息,生成驾驶场景视频;

2、输入初始场景图像、驾驶动作、交通约束结构化信息,生成未来驾驶场景视频;

3、输入初始场景图像、初始驾驶动作、交通约束结构化信息,预测未来驾驶动作;
 

图片

两阶段训练:

图片

1、Auto-DM理解交通结构化信息;

1.1、以单帧图像为监督,输入单帧结构化信息和文本提示,生成单帧图像;

1.2、以视频为监督,输入多帧结构化信息和文本提示,生成视频;

图片

2、ActionFormer学习生成和预测能力:以视频和驾驶动作为监督信息,输入初始场景图像、初始结构化信息、初始驾驶动作,生成未来场景场景视频,预测未来驾驶动作;


drivedreamer-2

图片

相比v1,v2的核心是引入大语言模型来生成用户自定义的驾驶场景视频。

用户输入query,通过大语言模型转换成车辆行驶轨迹,基于轨迹再生成高精地图,

引入UniMVM,统一视角内和视角间的空间一致性,提升时间和空间关联性;

FID提升30%,FVD提升50%;
 

图片

1、微调LLM生成轨迹:

1.1、人工构建text和python脚本样本对;

1.2、使用样本对数据集微调LLM;

图片


2、高精地图生成:

2.1、构造轨迹和高精地图样本对;

2.2、训练生成器;

图片

3、UniMVM:相比之前的多视角单独图像输入的范式,UniMVM统一拼接多视角到一张图像作为输入,去掉了cross-view的网络层;

4、结合以上的轨迹、高精地图、UniMVM和drivedreamer-1进行驾驶场景生成;

阅读 26

Logo

分享最新的 NVIDIA AI Software 资源以及活动/会议信息,精选收录AI相关技术内容,欢迎大家加入社区并参与讨论。

更多推荐