职位描述1. 主导机器人数据基础设施建设,打通千台级设备从端侧采集、弱网回传到云端入湖的完整链路,保障多模态数据高吞吐、低延迟、可恢复地持续流转; 2. 建设 PB 级数据存储与资产管理平台,统一数据格式、元数据、版本、权限和血缘体系,并通过缓存、预取和并行读取提升训练侧数据供给效率; 3. 设计可扩展的分布式数据流水线和算子体系,覆盖清洗、过滤、转换、预标注、自动质检、人工抽检与版本发布,支持算法团队灵活编排数据生产流程; 4. 完善任务调度、幂等校验、故障恢复和全链路可观测能力,解决大规模数据系统中的一致性、积压、性能和成本问题; 5. 与端侧、算法和训练团队共同构建数据闭环,将真机失败案例和数据缺口快速转化为可检索、可复用、可进入训练的数据集。任职要求1. 本科及以上学历,计算机、软件工程等相关专业,具备分布式系统或数据平台的实际研发经验; 2. 精通 Python,并熟练掌握 C++、Rust、Go 或 Java 中至少一种语言,具备良好的系统设计与工程实现能力; 3. 深入理解分布式系统、计算机网络、数据库和存储系统原理,能够分析一致性、吞吐、延迟与可靠性问题; 4. 熟悉 Kafka、S3、Spark、Ray、Flink 等技术中的一种或多种,并具备生产环境性能调优和故障排查经验; 5. 有大规模数据湖、流批处理、工作流或数据标注平台建设经验者优先;有大厂云平台、机器人、自动驾驶数据闭环或开源项目经验者优先。