职位描述
1、在强视频生成底模上研发 causal、chunk-wise、streaming world model;
2、设计和实现语义、相机、键鼠或具身动作的表示与注入方式;
3、解决长时生成、历史缓存、动作遵循和多条件组合问题;
4、建设与控制精度、状态持久性、反事实预测相关的数据和评测;
5、将研究模型推进到可交互 Demo,并参与论文、技术报告或开源成果。任职要求
核心经验
该岗位重点考察候选人在真实系统中积累的架构、训练与问题定位经验,包括以下一项或多项:
1、将视频生成模型改造成 causal、block-causal 或 autoregressive 模型;
2、开发 action-conditioned video/world model,让 camera、键鼠、机器人动作或其他连续信号稳定生效;
3、做过长视频、rolling KV、history condition、memory 或 clean-context cache;
4、做过流式或实时生成,以及 DMD、PCM、consistency distillation 等少步加速;
5、处理过动作响应衰减、长时漂移、误差累积、teacher-student 分布错位或条件泄漏。
候选人无需覆盖所有方向,但应在至少一条路线中具备深入的代码、训练和实验经验,并能够将相关经验迁移到面向真实世界的统一模型中。
任职要求
1、深入理解 diffusion/flow matching、Transformer/DiT 和视频生成;
2、曾亲自训练、修改或调试生成模型,而不只是调用推理接口;
3、熟悉 PyTorch,能够从 forward、tensor shape、attention mask 和 cache 定位问题;
4、在自回归视频、action conditioning、长视频或流式生成中至少有一项扎实经验;
5、能把想法转化为可靠 baseline、消融实验和可解释结论。
6、具备 Wan/HunyuanVideo 等视频底模、多视角或机器人 world model、游戏交互模型、大规模分布式训练或实时推理经验者优先。