职位描述
负责视频生成模型的后训练算法,基于 reward model、人工偏好和自动评测信号,提升模型在文本对齐、审美、动态、稳定性和用户满意度上的综合表现:
1. 设计视频生成后训练流程,包括 SFT、DPO、diffusion RL 等。
2. 基于多维 RM 构建训练 reward,优化文本-视频对齐、运动质量、美感、主体一致性和崩坏率。
3. 探索 reward hacking 防御、多 reward balance、online/offline preference data mixing。
4. 支持 recaption model RL,探索基于 benchmark 或 RM 的 prompt rewriting 优化。
5. 与 RM / 评测团队协作,构建可用于训练的高质量 preference 数据。
6. 分析后训练带来的能力提升和副作用,推动稳定迭代。任职要求
1. 熟悉 DPO、GRPO、NFT等经典 LLM / diffusion 后训练算法。
2. 有 LLM / diffusion 后训练、多模态 RL 经验优先。
3. 对 reward design、数据偏差、评测污染、reward hacking 有较深理解。
4. 能独立设计实验,并从复杂 case 中归因问题来源。