职位描述
研究负责人将负责该方向的核心技术路线,并带领团队完成:
1、从强视频底模到 causal、chunk-wise、streaming world model 的架构演进;
2、语义、相机、键鼠和具身动作的统一协议与差异化注入路径;
3、面向真实世界的数据体系,包括动作、状态、对象、接触和反事实 rollout;
4、长视频、rolling KV、memory、少步蒸馏和实时推理;
5、控制遵循、物理后果、状态持久性、causal leakage 和闭环评测;
6、能够验证真实物理干预、状态持久性和反事实预测能力的旗舰 Demo;
7、研究员、工程、数据和 Infra 团队的目标拆解与协同。任职要求
候选人应主导或核心负责过复杂的视频生成、世界模型、VLA 或交互式生成系统,既能够作出研究判断,也能够进入核心代码和训练现场。候选人应具备:
1、causal/autoregressive video、action-conditioned generation、长视频或流式生成经验;
2、对 DiT/MM-DiT、condition injection、cache、蒸馏和大规模训练的深入理解;
3、从数据、模型、训练、推理到评测形成闭环的 ownership;
4、在真实世界/VLA/多视角闭环,或实时交互视频/多控制/长程记忆中的一条深度经验;
5、能把另一条路线吸收到同一个系统中,而不是把世界模型局限为单一场景;
6、能定义关键问题、设计高信息量实验,并作出明确的技术取舍。
该岗位要求候选人同时具备研究判断、源码深度和系统 ownership,不适合仅承担汇报协调,或只关注视频观感而缺少控制与因果评测的工作方式。
研究条件与职责边界
该岗位的目标不是在成熟产品上优化单一指标,而是定义一种新的模型形态:将实时生成、语义交互、相机控制、键鼠控制和真实具身干预收敛到同一个因果世界模型中。
团队已具备 Wan 系视频底模上的 causal chunk-level 代码基础、清晰的四类控制设计、持续建设的数据协议与评测体系,以及中等规模以上的数据和算力投入。研究负责人对关键架构、数据路线、实验顺序和团队建设承担决策责任,并推动工作形成模型、论文、技术报告、开源成果或产品。
该岗位需要回答的核心研究问题是:
视频模型能否不只生成一个可观看的世界,而是学习一个可以被持续干预、能够记住改变,并对真实物理后果作出预测的世界