职位描述职位描述 视频生成模型研发:负责面向自动驾驶场景的视频生成大模型的算法设计与优化,探索 Diffusion/Flow Matching 等主流生成范式在驾驶场景视频合成中的应用与改进。 世界模型方向探索:以视频生成能力为基础,研究并构建自动驾驶世界模型,实现对驾驶场景的可控生成、未来帧预测与物理合理性建模,为端到端自动驾驶研发提供数据与仿真支撑。 可控生成与条件建模:研究多种条件控制方式(如轨迹条件、摄像头位姿、地图结构、天气/光照等)下的视频生成方案,提升生成内容的几何一致性、时序连贯性与场景多样性。任职要求基本条件 计算机科学、人工智能、计算机视觉或相关领域硕士及以上学历。 2年以上深度学习/计算机视觉相关研发经验,有视频生成或图像生成大模型方向研发背景。 核心技术要求 深入理解主流视频/图像生成模型架构,熟悉以下一项或多项: Diffusion Model(DDPM、DDIM、LDM 等) Flow Matching / Rectified Flow DiT(Diffusion Transformer) 及其视频扩展 VAE / Tokenizer 在视频压缩与重建中的应用 熟悉视频生成领域主流工作(如 Sora、CogVideo、Open-Sora、SeedAnce、通义万相、Wan 等),对其技术方案有深入理解。