Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

智算网络工程师

上海 社招 · 全职 AI Infra / 训练系统

职位描述

职位概述 参与智元具身智能云平台的网络规划与建设,负责IB或RoCE高性能网络、容器网络及IP地址管理。围绕分布式训练的通信需求,与计算、存储、系统集成和SRE团队协作,持续优化网络连通性、通信效率与故障恢复能力。 主要职责 1. 负责智算集群网络拓扑、地址和容量规划,结合计算及存储访问需求设计连通、隔离和冗余方案,形成可实施的配置规范及网络验收标准。 2. 负责IB或RoCE网络的配置、调优和维护,分析拥塞、丢包、链路异常与通信瓶颈,协同设备及计算团队改善分布式训练的通信效率。 3. 建设并维护Kubernetes容器网络与IPAM能力,完善地址分配、路由、网络策略及服务连通机制,保障不同租户和业务的网络隔离要求。 4. 建立网络连通、带宽、时延及集合通信测试方法,结合训练负载验证端到端表现,与计算和训练平台协作定位跨节点性能及兼容性问题。 5. 完善链路、设备及容器网络的监控和故障处理流程,配合SRE团队建设告警及排障手册,通过变更验证与应急演练提升网络恢复效率。 6. 推进网络配置、资产信息和地址资源的自动化管理,编写巡检及验收工具,与系统集成团队完成网络方案对接、交付检查和运维交接。 承担主要目标/关键任务 负责智算集群网络拓扑、地址和容量规划,结合计算及存储访问需求设计连通、隔离和冗余方案,形成可实施的配置规范及网络验收标准。 2. 负责IB或RoCE网络的配置、调优和维护,分析拥塞、丢包、链路异常与通信瓶颈,协同设备及计算团队改善分布式训练的通信效率。 3. 建设并维护Kubernetes容器网络与IPAM能力,完善地址分配、路由、网络策略及服务连通机制,保障不同租户和业务的网络隔离要求。 4. 建立网络连通、带宽、时延及集合通信测试方法,结合训练负载验证端到端表现,与计算和训练平台协作定位跨节点性能及兼容性问题。 5. 完善链路、设备及容器网络的监控和故障处理流程,配合SRE团队建设告警及排障手册,通过变更验证与应急演练提升网络恢复效率。 6. 推进网络配置、资产信息和地址资源的自动化管理,编写巡检及验收工具,与系统集成团队完成网络方案对接、交付检查和运维交接。 产出工作结果

任职要求

任职要求 1. 教育背景:本科及以上学历,计算机、网络工程、通信工程、电子信息等相关专业优先,重视网络基础与项目实践能力。 2. 工作经验:3年以上数据中心网络、云网络或高性能计算网络相关经验,能够独立完成网络方案与排障工作;5年以上相关经验,具备智算网络规划或性能优化经历者优先。 3. 具备扎实的TCP/IP、路由交换和Linux网络基础,熟悉数据中心网络的冗余、隔离与故障定位方法,能够独立分析复杂连通性问题。 4. 熟悉IB或RoCE中的至少一种网络技术,理解RDMA及高性能通信的关键约束,具有网络部署、故障处理或性能优化相关实践。 5. 了解Kubernetes容器网络、CNI和IPAM机制,熟悉Calico、Cilium或同类方案中的至少一种,能够排查地址、路由和网络策略问题。 6. 掌握Python、Shell或Go等至少一种语言,能够开发网络巡检和配置工具,具备测试验证、文档沉淀及跨计算与系统集成团队协作能力。 加分项 1. 具有GPU集群通信优化经验,使用过NCCL测试或同类工具,能够结合链路、交换配置、拓扑与任务负载定位分布式训练瓶颈。 2. 具有NetBox、自动化网络配置、网络遥测或地址治理实践,参与过网络变更回滚、故障演练或跨团队交付验收流程建设。