Ivyea Jobs 11113 roles · 197 companies · 刚刚
清程极智 · AI Infra

GPU 服务器集群管理

北京 / 深圳 社招 · 全职 训练系统 / 集群 工程开发

职位描述

1. 配置、管理高性能 GPU 服务器集群,确保其全天可用、性能可靠、可监控。 2. 提升服务器集群的日常利用效率,减少闲置或拥挤。 3. 通过标准化和自动化,协调管理不同型号、来自不同供应商的 GPU 服务器集群。 4. 处理服务器故障等紧急情况。

任职要求

1. 计算机科学或相关专业。 2. 具备管理 GPU 集群 / HPC 集群 / 超算集群的经验。 3. 熟练掌握 Linux 系统管理技能,包括网络、进程、软件包、日志、监控、权限等方面。 4. 掌握 GPU 系统管理技能,包括 GPU 驱动、GPU 监控、处理 GPU 故障等方面。 5. 掌握高性能网络(如 Infiniband、RoCE)管理技能。 6. 掌握高性能文件系统(如 ZFS、NFS、Lustre)管理技能。 7. 掌握集群调度器(包括 Slurm、Kubernetes)管理技能。 8. 具有通过自动化方式提升集群使用效率经验者优先,包括降低设备空置率、降低软件故障(如 OOM)率、降低故障响应时间等。 9. 具有国产加速卡管理经验者优先。 10. 具有担任重要集群的管理责任人经历者优先。
清程极智去官方页面投递 →