职位描述
1. 开发自动化运维平台与工具,简化AI基础设施的初始化与运维工作;
2. 参与AI基础设施的架构设计与开发,包括GPU集群、k8s容器集群、存储等;
3. 实施监控、告警、日志相关体系,确保AI基础设施的高可用性与稳定性。任职要求
1. 计算机/电子工程相关专业本科以上学历;
2. 熟练掌握至少一门编程语言(如Go、Python、C++、Java);
3. 熟悉Linux系统管理和运维开发体系,有自动化管理集群经验、kubernetes使用经验优先;
4. 有NVIDIA GPU服务器维护经验优先。