职位描述
1. 负责公司智算集群网络的规划、建设、优化、运维
2. 负责网络设备测试、选型和厂商沟通
3. 负责不断提升各业务场景网络可用性、降低网络延迟,持续跟进网络架构和技术演进任职要求
1. 学历专业:本科及以上学历,计算机科学与技术、人工智能等相关专业;
2. 熟悉 AI 集群主流拓扑(Spine-Leaf、胖树架构),熟练掌握 TCP/IP、RDMA(远程直接内存访问)协议,理解 RoCE、InfiniBand(IB)协议的原理与配置
3. 熟悉高性能网络硬件(基于Bcom交互芯片(TH4/5/6)的交换机,CX7RDMA网卡),了解Mellanox/NVIDIA InfiniBand 交换机、Intel/Ethernet 网卡、DPU 数据处理单元),了解 GPU 与网卡的协同机制(如 NVIDIA GPUDirect RDMA)。
4. 深度理解带宽、延迟、抖动、丢包率的影响因素,掌握 QoS 流量控制、拥塞管理(ECN、DCQCN)、流量整形等优化技术。
5. 掌握 SR-IOV、了解容器网络(Calico、Cilium)、K8s 网络插件的工作原理(AI 集群容器化部署常用)。
6. 熟练使用 iPerf3、pretest、tcpdump/Wireshark(抓包分析)、nvidia-smi/nccl-tests(GPU 通信测试)、Prometheus+Grafana(监控可视化)。
7. 掌握 RDMA 网卡配置、参数调优(如缓冲区大小、拥塞算法)、交换机队列配置、K8s 网络策略优化(如 Pod 带宽限制)等等。
8. 能通过日志分析、流量镜像、性能 profiling 定位网络瓶颈(如拥塞丢包、网卡中断均衡问题、RDMA 连接失败)。
9. 能根据 AI 集群规模(百卡 / 千卡/万卡)、业务场景(训练 / 推理)设计针对性的 Spine-Leaf 拓扑。