Ivyea Jobs 5947 roles · 66 companies · 刚刚
无问芯穹 · AI Infra

AI基础设施交付运维工程师

北京 / 上海 社招 · 全职 交付 / 解决方案(FDE)

职位描述

1. 负责智算集群的硬件和系统运维,同时协助网络与存储的硬件运维工作。 2. 诊断和处理各类智算服务器硬件和网络设备故障,执行集群设备巡检、维护、升级,保障集群和硬件 SLA。 3. 与各类设备、硬件厂商、IDC和内外部业务团队间进行沟通与协调,保障算力硬件、网络、存储等组件的安装配置符合业务运行需求,以支撑上层大模型训练与推理业务稳定运行。 4. 协助GPU 裸金属与容器化平台的交付、部署和基础环境构建;执行智算集群硬件验收与测试,对服务器、GPU、网络、存储等物理性能进行分析与判断。

任职要求

1. 本科及以上学历,具备三年以上的智算集群或大型数据中心/超算的运维经验。 2. 精通各类智算服务器、GPU和网络硬件体系,能熟练进行服务器、网络设备和存储服务器硬件的现场安装和远程运维操作。 3. 具备扎实的故障排查能力,对集群硬件安装、配置和运行时性能异常和故障告警有良好的分析诊断能力。 4. 可以接受不时的异地出差,前往各地IDC进行现场运维和协调工作。 5. 具备优秀的沟通能力和团队协作精神,能快速适应高强度的工作节奏。