Ivyea Jobs 5948 roles · 69 companies · 1 小时前
星尘智能 · 具身智能

多模态数据研究工程师

深圳 校招 · 全职 产品事业部 多模态 / 视觉 / 语音

职位描述

【岗位职责】 1. 负责 Ego、视频、多模态及互联网数据在具身智能模型训练中的前沿预研; 2. 持续跟进 Ego Video、Video Understanding、VLM、VLA、World Model 等方向的最新论文、数据集和开源工作; 3. 挖掘和评估适用于具身模型训练的开源及互联网多模态数据,包括第一视角视频、人类操作视频、手物交互、空间理解等数据; 4. 建立不同类型数据的分析和 Benchmark 体系,研究其在物体理解、动作理解、空间理解、任务规划等能力上的价值; 5. 研究 Ego 数据向机器人训练数据迁移的方法,包括数据筛选、任务抽取、Action / Object / State 标注、时序切分及语义结构化; 6. 开展数据实验,验证不同数据来源、数据类型、数据规模及数据配比对 VLM / VLA 等模型能力的影响; 7. 与数据算法、模型训练团队合作,将有价值的数据和预研方向转化为实际训练方案; 8. 持续探索新的多模态数据来源和数据范式,为具身模型预训练和能力扩展提供数据储备。 【任职要求】 1. 计算机、人工智能、机器人、自动化等相关专业本科及以上学历; 2. 熟悉 Python、PyTorch,具备基本的深度学习模型训练与实验能力; 3. 对 VLM、Video Understanding、Embodied AI、VLA、World Model 等至少一个方向有较深入理解; 4. 具备较强的论文阅读、技术调研和实验验证能力; 5. 能够独立完成从“问题提出 → 数据调研 → 实验设计 → 模型验证 → 结论分析”的完整预研过程; 6. 对数据敏感,能够从模型能力视角判断不同数据的潜在价值,而不仅是统计数据规模; 7. 具备良好的技术判断力和快速学习能力。 【加分项】 1.有 Ego / First-Person Video 相关研究或项目经验; 2.有 Ego4D、EPIC-KITCHENS、HOI、Human-Object Interaction 等数据使用经验; 3.有视频理解、动作识别、时序建模、Visual Grounding 等经验; 4.有 VLM / VLA 训练、Continual Pretraining 或数据配比实验经验; 5.有大规模互联网视频数据处理或 Dataset Curation 经验; 6.有机器人操作、具身智能、World Model 等相关研究经历; 7.有相关论文、开源项目或数据集建设经验。 立即投递