职位描述1. 职位概览 - 职位使命: 你将深度参与并支撑数十万小时级的真机交互数据链路,设计自动化的数据流转与回放系统。你将与团队协作,构建并优化异构数据的高效循环流程,为数据驱动的智能进化提供坚实的工程支撑。 2. 为什么加入我们? 在具身智能的角逐中,数据闭环的效率就是核心竞争力。 - 挑战最复杂的异构数据: 具身数据不只是视频,更融合了力觉、触觉、3D点云等多种模态。你将面临行业最高难度的数据治理与架构挑战。 - 软硬结合的全栈视角: 从真机遥操作 (Teleoperation) 的实时流控,到支撑大规模分布式训练的数据供给系统,你将构建起机器人连接物理世界的神经通路。 - 算法前哨与模型部署: 你将负责将前沿的 VLA 或世界模型部署到生产链路,支撑自动化的数据筛选与标注。在这里,你会深度使用这些最先进的模型,在工程实践中支持起算法的持续进化。 3. 岗位职责 - 构建具身数据闭环 (Data Loop): 设计并实现覆盖“采集-传输-清洗-标注-存储-训练-回放”的全链路高性能数据流水线。 - 高性能存储与检索: 针对大规模视频及传感器序列,设计高效的存储架构(如 HDF5, Parquet, 甚至是自研存储格式),支持毫秒级的随机采样。 - 多本体数据采集适配: 针对多样化的机器人本体,负责端侧数据采集逻辑的适配与性能优化。在 Infra 团队提供的通信中间件基础上,解决不同硬件终端的数据同步、标准化与高效回流问题。 - 自动化质量控制: 开发基于视觉算法和物理规则的自动化质检工具,构建机器人交互轨迹的“垃圾回收”机制,确保进入训练引擎的数据都是高价值样本。任职要求4. 任职要求 - 卓越的工程基石: 精通 Python/C++,具备优秀的系统架构设计能力,熟悉高性能分布式系统设计。 - 大规模数据实战: 熟悉大规模数据处理框架(Spark, Flink, Ray),对云原生架构或大规模存储方案有深度实践。 - 对具身的理解: 熟悉 Linux 环境,了解 ROS2 或其他机器人中间件,具备多模态传感器(摄像头、IMU、力传感器)数据处理经验。 - 极致的性能追求: 能够对数据链路中的任何瓶颈(IO, Network, Memory)进行深度调优。 5. 加分项 - 有自动驾驶数据闭环 (Data Loop) 或大规模视频搜索系统的建设经验。 - 主导或参与过大型开源数据处理项目。 - 熟悉多路视频流处理,或具备使用 CUDA 加速大规模视觉数据预处理的实战经验。