Ivyea Jobs 10686 roles · 174 companies · 刚刚
小马智行 · 具身智能

算法工程师 - 视频生成

广州 / 上海 / 北京 社招 · 全职 多模态 / 视觉 / 语音

职位描述

1. 基础模型研发:负责视频生成基础模型(Text-to-Video, Image-to-Video, Video Inpainting 等)的核心算法研发、架构探索与生成效果迭代。 2. 全链路训练与优化:深入参与生成模型的全生命周期研发,包括大规模预训练、SFT、人类偏好对齐(RLHF/DPO 等强化学习方法)。追求生成内容的真实感(Photorealism),大幅提升模型对客观物理规律的理解、时空连贯性以及复杂真实物理世界的还原能力(打造 Physical World Simulator 级别效果)。 3. 数据闭环与清洗:搭建并完善高质量视频数据工程流水线,主导基于多模态大模型(VLM)的海量视频数据自动化清洗、多维度标注、过滤与质量评估,构建高质量的训练数据集。 4. 推理加速与落地:结合业务需求,开展模型轻量化、显存优化及推理加速工作,提升云端推理吞吐效率与生成速度,保障算法的高效工程落地。

任职要求

1. 计算机/人工智能/数学等相关专业,本科及以上学历;熟练掌握 Python 及常用数据结构,具备扎实的算法底子与优秀的工程实现能力。 2. 熟悉主流深度学习框架(PyTorch),具备大规模分布式训练(如 DeepSpeed, Megatron, FSDP)的实操、调参及系统性的踩坑经验。 3. 掌握主流生成式视觉算法与基础理论:深刻理解 Diffusion Models(扩散模型)、Transformer/DiT 架构原理,熟悉主流图像/视频生成算法及底座。 4. 具备极强的数据敏感度,熟悉多模态大模型(如 Qwen-VL, GPT-4o 等)的应用,对复杂真实场景数据的提纯、清洗规则设计和 Prompt 体系构建有实战经验。 5. 强烈的工程落地导向,关注生成内容的逼真程度、动态细节及物理合理性,熟悉相关质量指标(如 FVD, 运动平滑度评估),能独立解析和修改前沿开源代码。 6. 具备快速学习能力与良好的沟通协作能力,有技术极客精神。 加分项 - 具备从零到一主导或深度参与大规模视频生成/图像生成基础模型训练经验者优先。 - 在生成模型的强化学习(RLHF/DPO)与真实偏好对齐方向有深入研究或实际落地经验者优先。 - 有自动驾驶仿真、世界模型(World Models)或物理世界模拟视频生成相关研发经验者极大加分。 - 在开源社区活跃,对知名生成式项目有过核心代码贡献者优先。 - 在 CVPR, ICCV, ECCV, NeurIPS 等顶级会议发表过生成方向高质量论文者优先。
小马智行去官方页面投递 →