职位描述
1. 负责智算集群的硬件和系统运维,同时协助网络与存储的硬件运维工作。
2. 诊断和处理各类智算服务器硬件和网络设备故障,执行集群设备巡检、维护、升级,保障集群和硬件 SLA。
3. 与各类设备、硬件厂商、IDC和内外部业务团队间进行沟通与协调,保障算力硬件、网络、存储等组件的安装配置符合业务运行需求,以支撑上层大模型训练与推理业务稳定运行。
4. 协助GPU 裸金属与容器化平台的交付、部署和基础环境构建;执行智算集群硬件验收与测试,对服务器、GPU、网络、存储等物理性能进行分析与判断。任职要求
1. 本科及以上学历,具备三年以上的智算集群或大型数据中心/超算的运维经验。
2. 精通各类智算服务器、GPU和网络硬件体系,能熟练进行服务器、网络设备和存储服务器硬件的现场安装和远程运维操作。
3. 具备扎实的故障排查能力,对集群硬件安装、配置和运行时性能异常和故障告警有良好的分析诊断能力。
4. 可以接受不时的异地出差,前往各地IDC进行现场运维和协调工作。
5. 具备优秀的沟通能力和团队协作精神,能快速适应高强度的工作节奏。