职位描述
【岗位职责】
1. 负责 Ego、视频、多模态及互联网数据在具身智能模型训练中的前沿预研;
2. 持续跟进 Ego Video、Video Understanding、VLM、VLA、World Model 等方向的最新论文、数据集和开源工作;
3. 挖掘和评估适用于具身模型训练的开源及互联网多模态数据,包括第一视角视频、人类操作视频、手物交互、空间理解等数据;
4. 建立不同类型数据的分析和 Benchmark 体系,研究其在物体理解、动作理解、空间理解、任务规划等能力上的价值;
5. 研究 Ego 数据向机器人训练数据迁移的方法,包括数据筛选、任务抽取、Action / Object / State 标注、时序切分及语义结构化;
6. 开展数据实验,验证不同数据来源、数据类型、数据规模及数据配比对 VLM / VLA 等模型能力的影响;
7. 与数据算法、模型训练团队合作,将有价值的数据和预研方向转化为实际训练方案;
8. 持续探索新的多模态数据来源和数据范式,为具身模型预训练和能力扩展提供数据储备。
【任职要求】
1. 计算机、人工智能、机器人、自动化等相关专业本科及以上学历;
2. 熟悉 Python、PyTorch,具备基本的深度学习模型训练与实验能力;
3. 对 VLM、Video Understanding、Embodied AI、VLA、World Model 等至少一个方向有较深入理解;
4. 具备较强的论文阅读、技术调研和实验验证能力;
5. 能够独立完成从“问题提出 → 数据调研 → 实验设计 → 模型验证 → 结论分析”的完整预研过程;
6. 对数据敏感,能够从模型能力视角判断不同数据的潜在价值,而不仅是统计数据规模;
7. 具备良好的技术判断力和快速学习能力。
【加分项】
1.有 Ego / First-Person Video 相关研究或项目经验;
2.有 Ego4D、EPIC-KITCHENS、HOI、Human-Object Interaction 等数据使用经验;
3.有视频理解、动作识别、时序建模、Visual Grounding 等经验;
4.有 VLM / VLA 训练、Continual Pretraining 或数据配比实验经验;
5.有大规模互联网视频数据处理或 Dataset Curation 经验;
6.有机器人操作、具身智能、World Model 等相关研究经历;
7.有相关论文、开源项目或数据集建设经验。
允许3个月内投递3个职位,请选择适合的职位进行投递
立即投递