职位描述
1. 配置、管理高性能 GPU 服务器集群,确保其全天可用、性能可靠、可监控。
2. 提升服务器集群的日常利用效率,减少闲置或拥挤。
3. 通过标准化和自动化,协调管理不同型号、来自不同供应商的 GPU 服务器集群。
4. 处理服务器故障等紧急情况。任职要求
1. 计算机科学或相关专业。
2. 具备管理 GPU 集群 / HPC 集群 / 超算集群的经验。
3. 熟练掌握 Linux 系统管理技能,包括网络、进程、软件包、日志、监控、权限等方面。
4. 掌握 GPU 系统管理技能,包括 GPU 驱动、GPU 监控、处理 GPU 故障等方面。
5. 掌握高性能网络(如 Infiniband、RoCE)管理技能。
6. 掌握高性能文件系统(如 ZFS、NFS、Lustre)管理技能。
7. 掌握集群调度器(包括 Slurm、Kubernetes)管理技能。
8. 具有通过自动化方式提升集群使用效率经验者优先,包括降低设备空置率、降低软件故障(如 OOM)率、降低故障响应时间等。
9. 具有国产加速卡管理经验者优先。
10. 具有担任重要集群的管理责任人经历者优先。