Ivyea Jobs 5948 roles · 69 companies · 刚刚
银河通用 · 具身智能

具身数据算法工程师

北京 社招 · 全职 算法中心 / 算法类 具身智能 / 机器人

职位描述

我们正在为下一代具身基座模型 / VLA(视觉-语言-动作)模型打造覆盖全生命周期的训练数据平台,贯通预训练到后训练的完整链路。 我们处理的不是单一来源的数据,而是一座完整的 具身数据金字塔——跨越多种采集形态,以及保真度与规模之间的权衡。 以下四个方向,精通其一即可投递,具备跨方向能力者优先: 方向一 · 数据标注 能做 ego hand / body pose、物体 2D/3D bbox/pose、retargeting、subtask / CoT(思维链)标注等具身标注任务,并能向动作-结果因果、交互类型等高阶语义标注延伸;具备云端预标注模型闭环经验,能通过 issue 数据反哺模型、逐步提升自动标注精度,形成「人修一批、模型进一步、自动化覆盖更多」的正循环。 方向二 · 数据挖掘 数据挖掘是整个数据体系「可解释、可配比、可分析」的基石——唯有在多维标签体系下把每一条数据精准刻画,后续的分布分析、配比优化与定向补采才有依据。你需要构建覆盖场景 / 光照、原子动作语义库(grasp / pick / place / pour 等)、动作速度与质量、轨迹光滑度与多样性、接触类型、失败模式、任务复杂度等多维度的大规模标签体系;并基于多模态 Embedding 搭建向量数据库,支撑大规模相似度检索、去重清洗、长尾 / corner case 挖掘与跨场景检索。同时能灵活组合规则方法与 AI / 模型方法开发各类挖掘算子,在保证精度的前提下兼顾成本与规模化生产。 方向三 · 数据 Pipeline 设计过复杂的大型数据 Pipeline 框架,能把数采入库、标注、挖掘清洗、统计等环节编排成稳定高效的生产链路,对吞吐效率、数据折损率、任务调度与容错等核心指标有深入的优化经验;能将 Agent 引入数据生产与运营,实现数据流转、异常处理与开发工作的自动化。 方向四 · 数据质量与价值评估 能设计多维度的质量与价值评估体系,对数据做系统化度量与分级:既能在基础信号层把控数据质量(Image&Action 时间对齐、内外参管理、图像质量评估等),也能在语义层评估数据的有效性与稀缺价值——识别长尾与冗余,衡量同类任务的完成方式多样性;并将「质量分 / 稀缺价值度」转化为可执行的采样、配比与定向补采策略,持续优化数据集的整体质量与分布。

任职要求

硕士及以上学历优先,计算机、人工智能、机器人学或相关交叉专业; 有海量非结构化噪声数据(自动驾驶长尾、具身 / 众包标注数据等)的清洗、挖掘与评测实战,较强的 Bad Case 归因与算法迭代能力; 具备基本的机器人运动学与动力学基础。 以下加分项,满足其一即有竞争力: 具备模型训练经验,能从训练侧视角反推数据问题、推动数据工作并取得明确成果; 熟悉 LeRobot、Open X-Embodiment 等主流具身数据格式,有真机遥操作 / UMI / 仿真 / AIGC 数据合成及 Sim2Real 相关经验; 有借助 Agent 做数据运营 / 自动化开发的实践经验; 在 RSS、CoRL、ICRA、IROS、CVPR、NeurIPS 等顶会以一作发表过论文。 立即投递