职位描述
1.负责具身数据质量、预标注、高价值挖掘、多样性分析与数据 - 模型闭环算法研发,服务 VLA 模型训练。
2.质量建模与清洗:多模态数据(视觉 / 语言 / 触觉 / 状态 / Action)质量评估、异常识别、时空对齐与隐私脱敏;建立可解释的质量评分与错误类型体系。
3.预标注模型:基于 VLM / 视频理解 / 多模态大模型,研发动作切分、Caption、指令生成、对象识别等能力,落地数据生产链路。
4.高价值数据发现:从海量数据中挖掘高质量 / 高复杂度 / 长尾 / 边界样本;构建检索、聚类、去重与数据价值评估。
5.多样性与分布分析:搭建 "场景 × 任务 × 物体 × 动作 × 轨迹 × 终态" 多样性矩阵,量化覆盖度与分布差异,输出可视化看板。
6.数据 - 模型闭环:与 VLA 团队协作分析数据 / 质量 / 采样对模型效果的影响,反向定位数据缺口,推动采集、清洗与训练策略迭代。任职要求
1.本科及以上(CS / AI / 自动化 / 机器人 / 数学等相关专业)
2.熟练 Python + 至少一种深度学习框架(PyTorch / TF)
3.熟悉 VLM / 视频理解 / 多模态大模型 / VLA;理解表征学习、对比学习、检索、异常检测
4.能独立完成 "问题定义→算法研发→实验→部署" 闭环,跨团队高效协同
5.能熟练使用 AI Coding / Agent Coding 工具提效
【加分项】
机器人操作 / 自动驾驶 / 视频等多模态时序数据经验;大规模数据清洗 / 数据飞轮 / 数据配比优化经验;VLM / VLA / 世界模型 / 机器人学习项目经验;高水平论文 / 数据竞赛 / 开源贡献。
【岗位价值】
构建连接 "数据生产" 与 "模型能力" 的核心数据智能系统,直接影响 VLA 模型的训练效率、泛化能力与真实机器人表现。