职位描述
1、负责视频生成模型的行业微调与后训练,包括 SFT、LoRA、DPO、GRPO、Diffusion RL 等;
2、根据客户需求分析模型能力差距,设计训练目标、数据需求和评测方案,并与数据团队协作完成数据验收;
3、构建或使用偏好数据、Reward Model 和自动评测信号,提升视频的画质、动态、可控性和稳定性;
4、探索光流、运动控制、蒸馏、少步生成和量化等专项技术,以及参考图生视频、角色定制等行业新玩法;
5、负责实验设计、效果分析、问题归因和模型版本迭代;不负责数据生产管理、推理部署和线上性能优化。任职要求
1、熟悉 Diffusion、Flow Matching、Transformer 等生成模型及训练方法;
2、有视频生成模型微调或后训练经验,熟悉 SFT、DPO、GRPO、Diffusion RL 中的一种或多种;
3、对视频画质、动态、主体一致性、可控性和时序稳定性有较强判断能力;
4、熟悉 PyTorch,具备较强的实验设计、问题分析和跨团队协作能力;
5、有 Reward Model、偏好数据、光流/运动建模或模型蒸馏经验者优先。