职位描述
我们正在为下一代具身基座模型 / VLA(视觉-语言-动作)模型打造覆盖全生命周期的训练数据平台,贯通预训练到后训练的整链路。
我们处理的不是单一来源的数据,而是一座完整的 具身数据金字塔——跨越多种采集形态,以及保真度与规模之间的权衡。
你的工作,就是让这座金字塔的每一层数据都做到「干净、对齐、可用、可度量」,直接决定模型 Scaling 的上限。
岗位职责
数据 SDK 与服务开发(核心职责) 设计并实现具身数据 Python SDK,围绕 Dataset / Episode / Frame / Tag / Modality 等核心抽象提供高易用接口;封装数据查询、加载、变换、导出等能力,支持灵活返回多模态数据(图像 / 视频 / 动作 / 力觉 / 语言指令等),让算法团队以最小成本获取所需数据。
声明式数据获取能力建设 支持算法团队以类 SQL 或 DSL 的方式声明式获取数据(如「某时间段 + 某场景 + 某配比」的数据子集);设计类似 AWS ARN 的资源定位机制,对接底层多模态数据库,实现数据的灵活检索与路由。
数据处理算子开发 将质量校验、清洗、标注、配比等业务逻辑抽象为单一职责的数据处理算子,集成至 Airflow / Ray 等调度框架,支撑数据生产链路的高吞吐与高容错。
数据格式与加载优化 攻克 LeRobot / mcap / ROS bag / HDF5 等具身与智驾数据格式的解析与解码加速、视频硬解、帧级随机访问、多模态时间对齐等核心工程问题,支撑十万小时级数据的高效加载与训练对接。
数据资产管理 建设数据集版本管理、血缘追踪、可复现的 training recipe 机制,确保算法团队能够精确复现任意历史训练数据配置,保障数据可信、可复现、可审计。任职要求
数据服务能力建设经验:主导或核心参与过面向算法 / 业务团队的数据 SDK / 数据查询接口 / 数据服务的设计与开发;有为下游用户提供「声明式数据获取」能力的实战经验(如设计 DSL、类 SQL 接口、资源定位符等)。
具身 / 智驾数据领域经验:精通 LeRobot / mcap / ROS bag / HDF5 等至少两种具身或智驾常用数据格式;在机器人 / 智驾 / 多模态感知领域有 2 年以上数据工程经验,处理过多模态时序数据(图像 / 视频 / 动作 / 力觉 / 语言指令等)。
Python 工程能力:5 年以上 Python 开发经验,精通现代 Python 工程实践(类型标注 / dataclass / asyncio / 性能剖析等),具备扎实的 SDK / 库 / 接口设计与封装能力,能独立完成复杂模块的设计、开发、调试与性能优化;能用 C++ 做关键路径底层性能加速者加分。
数据 Pipeline 与算子编排:开发或主导过数据生产 / 离线处理 Pipeline;能将业务逻辑拆解为单一职责算子并集成至 Airflow / Ray 等框架;熟悉 DAG 编排、高并发调度与容错机制。
多模态数据处理:具备以下至少两项的实际工程经验——视频解码加速(硬解 / 关键帧索引 / 帧级随机访问)、多模态时间戳对齐、大规模数据缓存与加载优化。
加分项
读过 LeRobot / Open-X-Embodiment / DROID 等开源具身数据集的源码与数据规范;
理解 RGB / 深度 / LiDAR / IMU / 力-力矩 / 触觉 / 关节编码器等多模态传感器原理,熟悉标定、时间同步与坐标系对齐;
具备相关底层功底:机器人动力学 / 运动学、时序信号对齐、SLAM / 多视图几何等;
有将 Agent / LLM 工具链落地到数据服务或数据生产的经验;
有十万小时级具身 / 机器人数据系统的建设经验;
有 VLA / VLM 模型训练数据流程的协作经验。
立即投递