Ivyea Jobs 11438 roles · 206 companies · 刚刚
东方算芯 · AI for Science

*SRE 集群网络优化工程师/校园招聘

上海 校招 · 全职 校园招聘 训练系统 / 集群预训练 / 基座 职能 / 支持

职位描述

1. 负责公司智算集群网络的规划、建设、优化、运维 2. 负责网络设备测试、选型和厂商沟通 3. 负责不断提升各业务场景网络可用性、降低网络延迟,持续跟进网络架构和技术演进

任职要求

1. 学历专业:本科及以上学历,计算机科学与技术、人工智能等相关专业; 2. 熟悉 AI 集群主流拓扑(Spine-Leaf、胖树架构),熟练掌握 TCP/IP、RDMA(远程直接内存访问)协议,理解 RoCE、InfiniBand(IB)协议的原理与配置 3. 熟悉高性能网络硬件(基于Bcom交互芯片(TH4/5/6)的交换机,CX7RDMA网卡),了解Mellanox/NVIDIA InfiniBand 交换机、Intel/Ethernet 网卡、DPU 数据处理单元),了解 GPU 与网卡的协同机制(如 NVIDIA GPUDirect RDMA)。 4. 深度理解带宽、延迟、抖动、丢包率的影响因素,掌握 QoS 流量控制、拥塞管理(ECN、DCQCN)、流量整形等优化技术。 5. 掌握 SR-IOV、了解容器网络(Calico、Cilium)、K8s 网络插件的工作原理(AI 集群容器化部署常用)。 6. 熟练使用 iPerf3、pretest、tcpdump/Wireshark(抓包分析)、nvidia-smi/nccl-tests(GPU 通信测试)、Prometheus+Grafana(监控可视化)。 7. 掌握 RDMA 网卡配置、参数调优(如缓冲区大小、拥塞算法)、交换机队列配置、K8s 网络策略优化(如 Pod 带宽限制)等等。 8. 能通过日志分析、流量镜像、性能 profiling 定位网络瓶颈(如拥塞丢包、网卡中断均衡问题、RDMA 连接失败)。 9. 能根据 AI 集群规模(百卡 / 千卡/万卡)、业务场景(训练 / 推理)设计针对性的 Spine-Leaf 拓扑。
东方算芯去官方页面投递 →