职位描述
1、数据回传与落盘链路:设计并实现机器人端到云端的数据回传系统,覆盖遥操作采集站、真机部署车队、仿真集群等多种数据源,保障高吞吐、断点续传、低丢包;
2、多模态数据存储:构建以 MCAP 为核心格式的机器人数据存储方案,支持视频流、点云、IMU、关节轨迹、力传感器、语言指令等异构信号的统一封装、索引与按时间戳切片检索;
3、PB 级数据湖建设:基于 S3 / OSS / COS 对象存储 + Iceberg/Lance 等数据湖技术,设计冷热分层、生命周期管理、版本控制(数据集 Git-like 管理)方案;
4、数据服务层:提供高性能的数据读取 SDK / DataLoader,支撑训练侧单机多卡 / 多机多卡的数据吞吐需求,优化大视频/大点云场景下的 IO 瓶颈;
5、数据处理 Pipeline:用 Go / Rust 构建高性能的数据预处理、格式转换、压缩、抽帧、对齐工具链,替代 Python 性能瓶颈模块;
6、可观测性与数据治理:搭建数据质量监控、数据血缘、数据一致性校验体系,支持算法团队快速发现并修复问题数据;
7、私有化 & SaaS 双形态:支持平台在客户私有云环境下的部署,兼顾公司 SaaS 服务化能力。任职要求
1、计算机相关专业本科及以上,有过后端 / 分布式系统 / 数据平台开发经验;
2、精通 Go 或 Rust 至少一种系统级语言,有生产环境大规模服务落地经验;Python 熟练(用于数据处理与工具脚本);
3、熟悉 AWS S3 / 阿里云 OSS / 腾讯云 COS 至少一种对象存储的 API、性能特性、分片上传、预签名 URL、生命周期策略等;
4、熟悉 Linux、Docker、Kubernetes,具备云原生服务开发与部署能力;
5、熟悉至少一种消息中间件(Kafka / Pulsar / NATS)和一种流/批处理框架(Flink / Spark / Ray Data);
6、熟悉至少一种 SQL 数据库(PostgreSQL / MySQL)和一种 NoSQL(Redis / MongoDB / ClickHouse)。
加分项:
1、有 MCAP / rosbag / HDF5 / LeRobot / RLDS 等机器人数据格式的处理经验,或深入了解其二进制结构;
2、熟悉 ROS1 / ROS2、DDS、zenoh、zmq 等机器人通信中间件;
3、有数据湖(Apache Iceberg / Hudi / Delta Lake / Lance)或向量数据库(Milvus / LanceDB)生产落地经验;
4、有 PB 级视频 / 多模态数据平台从 0 到 1 搭建经验(自动驾驶、安防、短视频平台经历都 OK);
5、熟悉 gRPC / Protobuf / FlatBuffers,有高性能 RPC 框架开发经验;
6、熟悉 GPU 训练数据加载优化(WebDataset、NVIDIA DALI、FFCV 等);
7、对 VLA、端到端机器人模型的训练数据需求有理解;
8、活跃的开源贡献者(Foxglove、MCAP、Apache Arrow、DuckDB 等项目的 contributor 强烈优先)。