AI 基础设施运维工程师(AI Infra 运维工程师)
职位描述
岗位背景
当前算法团队大量精力消耗在算力基础设施基础环境问题排查,本岗位优先聚焦集群运维能力,平台开发作为加分项;主要负责自建 GPU 智算集群,同时对接公有云算力平台,不要求从零开发完整机器学习平台,核心目标释放算法同学基础环境排查工作量,具备独立故障定位、根因分析与方案输出能力,不能完全依赖云厂商售后。(这段内部看,拉平背景信息)
岗位职责
负责大规模 GPU 集群全生命周期运维,覆盖物理服务器到 Kubernetes 算力资源池,包含集群纳管、巡检、变更、节点排空、故障恢复、设备退役等运维自动化能力建设。
维护 NVIDIA GPU 软件栈环境:GPU 驱动、GPU Operator、Device Plugin、DCGM,保障容器内 GPU 运行环境稳定;处理掉卡、Xid 报错、ECC、GPU 性能退化等硬件与软件故障。
负责 IB/ROCE 高速训练网络运维:RDMA、PFC/ECN、NCCL 相关的需求梳理、上线验收、故障定位,协同网络团队处理多机分布式训练网络问题,解决 NCCL timeout 等训练报错。
负责训练存储体系运维,包含并行共享文件系统、对象存储、缓存、数据挂载的健康度保障;对接公有云存储,处理跨区存储同步、本地‑云端双向数据传输问题。
负责 Kubernetes 体系运维:控制面、工作节点、CNI、CSI、容器运行时、DNS、证书管理、集群版本升级;处理调度失败、节点异常等集群问题,保障大规模分布式训练任务稳定运行。
对接公有云算力平台(金山云星流、联通云星罗等),完成 GPU 机器采购选型,识别硬件、组网、存储的选型风险;协同云厂商售后,推动故障卡更换、网络 / 存储问题闭环,做问题的主导排查方。
负责权限治理:打通内部代码仓云上访问权限、云上机器网络访问管控,终止超额、不合规资源使用。
参与 7*24 值班、重大训练任务保障,完成故障复盘、容量规划,协同硬件、网络、存储、供应商完成问题闭环;沉淀运维 SOP,通过 Shell/Python/Ansible 等工具将人工流程自动化。任职要求
5 年以上 Linux、Kubernetes、HPC/AI 智算基础设施相关工作经验,3 年以上生产环境 K8s 运维实战经验。
精通 Kubernetes 控制面、调度、网络、存储,具备复杂节点、任务故障排查定位能力。
深度熟悉 NVIDIA 整套 GPU 软件栈,能够定位 GPU 报错、驱动、容器 GPU 运行时、性能瓶颈类问题。
熟悉 InfiniBand / ROCE‑V2 高速网络,理解 RDMA、PFC、ECN、MTU、NCCL,具备分布式训练网络故障排查经验。
熟悉多机多卡分布式训练,了解 PyTorch Distributed / MPI / NCCL 至少一种,能够处理训练侧基础设施导致的任务异常。
熟悉并行文件系统、Ceph、NFS、对象存储、高性能缓存中至少两类,熟悉云上存储对接与数据流转。
掌握 Shell,至少会 Python/Go/Ansible 其中一项,可把运维操作 SOP 自动化落地;机器学习平台开发能力为加分项,非硬性要求。
具备生产故障应急处置、变更管理、文档沉淀能力,擅长跨团队协同,能够独立完成问题根因分析并输出改进方案,不依赖外部厂商定位问题。
补充说明
本岗位不要求自研完整机器学习平台;平台开发能力作为后续储备加分项,现阶段以基础设施运维、故障独立排查为核心。目标把算法工程师从底层环境故障中解放出来。(这段内部看,拉平能力边界)
允许3个月内投递3个职位,请选择适合的职位进行投递
立即投递