职位描述
1、视频/多模态/3D-4D encoder 的架构设计与训练;
2、JEPA / DINO 类自监督表示学习方法的改进与落地;
3、通过多模态表征融合/统一,实现对统一世界状态的建模;任职要求
1、海内外知名院校硕士及以上学历,计算机、人工智能、数学、自动化等相关专业优先;
2、有视频或多模态 encoder 研究经验,熟悉 ViT / VideoMAE / TimeSformer / 3D-ViT 等架构;
3、有多模态统一表征/多模态token融合研究经验,熟悉视觉/语言/深度等模态的统一表征建模
4、深度理解自监督表示学习方法(JEPA / DINO / MAE / BEiT),能分析不同预训练目标对下游任务的影响;
5、有中等规模模型(≥ 数亿参数)的独立训练经验,能诊断 loss 异常和表征退化;
6、熟 PyTorch,做过从问题定义到实验验证的完整研究闭环。
加分项:
1、有 V-JEPA / V-JEPA2 / DINOv2 的复现或二次开发经验
2、做过 3D/4D 表征学习(点云 / NeRF feature / 4D occupancy)
3、有丰富的实习/工作经历,独立解决产业界的难题。
4、有顶会一作论文(CVPR / ICCV / NeurIPS / ICML / ICLR)