Ivyea Jobs 6655 roles · 90 companies · 刚刚
智元机器人 · 具身智能

分布式数据工程师

北京 / 上海 社招 · 全职 数据 / 标注

职位描述

岗位背景 我们是智元机器人具身研究中心的 Infra 团队,正在为千台级机器人(Embodied AI)构建连接"物理世界"与"云端训练"的闭环数据基础设施。 本岗位聚焦于大规模分布式数据系统的构建。你需要将物理分布在不同地点的数千台机器人产生的数据,实时、可靠地回传至云端,并高效接入大规模分布式训练集群。这是一个需要足够 Scale、足够健壮的分布式系统工程挑战。 核心职责 1. 端到云数据回传系统:构建从千台级机器人到云端的实时数据回传链路,解决跨地域、弱网环境下的高吞吐、低延迟传输问题,确保数据完整性与时序一致性。 2. 云端数据存储与管理:设计并实现 PB 级规模的数据存储系统,支持高并发写入与高效读取,满足训练侧对数据吞吐量的极致需求。 3. 分布式数据流水线:构建从数据采集、传输、存=储到训练消费的端到端流水线,实现数据的高效流转,消除训练过程中的 I/O 瓶颈。 4. 系统可靠性与可观测性:建设分布式系统的容错机制、故障恢复能力与全链路可观测体系,确保千台规模下系统的稳定运行。

任职要求

技术要求 1. 扎实的软件工程基础:精通 Python,具备 C++/Rust 等系统编程语言经验;有良好的代码设计能力与工程实践习惯。 2. 分布式系统原理:深入理解分布式系统的核心概念(CAP、一致性模型、容错机制),能够设计和实现可扩展、高可用的分布式架构。 3. 计算机网络:熟悉 TCP/IP 协议栈,理解网络传输的性能优化原理;有弱网环境下的系统设计经验者优先。 4. 分布式中间件:熟悉主流消息队列(Kafka/RabbitMQ)、对象存储(S3)、数据库等中间件的原理与使用,具备生产环境下的调优经验。 加分项 1. 有大规模分布式存储或流处理系统的开发经验 2. 有千台级设备规模的数据管道设计与运维经验 3. 主导或参与过具有影响力的分布式系统开源项目 4. 在分布式系统领域发表过研究成果
智元机器人去官方页面投递 →