职位描述
职位概述 负责公司 AI 基础设施的网络架构设计、部署与运维,保障 AI 训练集群、推理平台及相关 IT 系统的稳定高效运行。结合 AI 业务特点,优化网络性能,构建自动化、智能化的网络运维体系。 岗位职责 AI 基础设施网络架构 设计与优化 AI 训练集群、GPU 服务器的高速网络架构(RDMA/RoCE、InfiniBand 等) 负责数据中心网络规划,包括 TOR/SPINE 架构、VLAN、VXLAN 等配置 评估并选型网络设备(交换机、网卡、光纤等),满足 AI 大模型训练的高带宽、低时延需求 AI 平台运维支持 负责 AI 训练平台、推理服务的网络连通性与性能保障 排查 AI 集群网络故障,包括丢包、拥塞、带宽瓶颈等问题 配合算法团队进行分布式训练的网络调优 IT 系统与网络管理 维护公司整体 IT 网络环境,包括办公网、生产网、VPN、防火墙等 管理网络安全策略,保障 AI 数据与模型资产的安全 负责服务器、存储等 IT 基础设施的日常运维 网络自动化与智能化 开发网络自动化运维脚本与工具,提升运维效率 利用 AI/ML 技术构建网络异常检测、性能预测、故障自愈系统 建设网络监控告警体系,实现全链路可视化 技术支持与协作 为研发、算法、产品等团队提供网络技术支持 参与云原生、容器化环境的网络方案设计(Kubernetes CNI、Service Mesh 等) 跟踪前沿网络技术,推动技术升级与创新落地
基本要求 本科及以上学历,计算机、网络工程、通信等相关专业 3 年以上数据中心网络或 IT 运维相关工作经验 熟悉 TCP/IP 协议栈,深入理解二层 / 三层网络原理 具备交换机、路由器、防火墙等网络设备的配置与排障能力 技术要求 有 GPU 集群、AI 训练平台网络运维经验者优先 了解 RDMA、RoCE、InfiniBand 等高速互联技术 熟练掌握 Python/Shell 等至少一种脚本语言,具备自动化运维开发能力 熟悉 Linux 系统运维,了解 KVM、Docker、Kubernetes 等虚拟化 / 容器技术 具备网络安全基础知识,了解零信任、等保等安全规范