极佳科技的自动驾驶场景生成模型drivedreamer和drivedreamer-2
·
极佳科技的自动驾驶场景生成模型drivedreamer和drivedreamer-2
原创 linger 黑客与作家 2024年09月19日 21:52 广东
drivedreamer


3种应用模式:
1、输入文本提示和交通约束结构化信息,生成驾驶场景视频;
2、输入初始场景图像、驾驶动作、交通约束结构化信息,生成未来驾驶场景视频;
3、输入初始场景图像、初始驾驶动作、交通约束结构化信息,预测未来驾驶动作;

两阶段训练:

1、Auto-DM理解交通结构化信息;
1.1、以单帧图像为监督,输入单帧结构化信息和文本提示,生成单帧图像;
1.2、以视频为监督,输入多帧结构化信息和文本提示,生成视频;

2、ActionFormer学习生成和预测能力:以视频和驾驶动作为监督信息,输入初始场景图像、初始结构化信息、初始驾驶动作,生成未来场景场景视频,预测未来驾驶动作;
drivedreamer-2

相比v1,v2的核心是引入大语言模型来生成用户自定义的驾驶场景视频。
用户输入query,通过大语言模型转换成车辆行驶轨迹,基于轨迹再生成高精地图,
引入UniMVM,统一视角内和视角间的空间一致性,提升时间和空间关联性;
FID提升30%,FVD提升50%;

1、微调LLM生成轨迹:
1.1、人工构建text和python脚本样本对;
1.2、使用样本对数据集微调LLM;

2、高精地图生成:
2.1、构造轨迹和高精地图样本对;
2.2、训练生成器;

3、UniMVM:相比之前的多视角单独图像输入的范式,UniMVM统一拼接多视角到一张图像作为输入,去掉了cross-view的网络层;
4、结合以上的轨迹、高精地图、UniMVM和drivedreamer-1进行驾驶场景生成;
阅读 26
更多推荐




所有评论(0)