职位描述
1.负责运维自动化平台的整体架构设计与开发,包括批量运维、节点管理、作业调度及自动化工具链建设;
2.建设 CMDB 系统,实现服务器、GPU、网络及集群资源的自动发现、建模与管理;
3.开发 GPU 集群自动化运维能力,包括节点健康检测、故障隔离、自动修复及资源状态管理;
4.建设 Kubernetes 集群管理平台,提升集群运维效率及稳定性;
5.推动基础设施自动化能力建设,降低人工运维成本,提高系统可靠性与可维护性;
6.参与基础设施架构优化,提升系统的可扩展性及运维效率。任职要求
1.计算机科学、软件工程或相关专业本科及以上学历,3 年及以上 DevOps 或运维平台研发经验;
2.熟悉至少一种编程语言(Python / Go),具备良好的工程能力与代码规范意识;
3.熟悉 Linux 操作系统,理解系统资源管理、进程管理及网络基础;
4.熟悉 Docker、Kubernetes 等容器技术,理解容器调度及运行机制;
5.熟悉基础设施自动化工具或框架,具备自动化系统设计经验;
6.具备良好的系统设计能力,能够构建高可靠、高可扩展的运维平台;
7.具备良好的沟通能力及责任意识,能够推动跨团队协作。
加分项
1.有运维平台或基础设施平台研发经验;
2.有大规模 Kubernetes 集群运维经验;
3.有 GPU 集群运维或 AI infra 经验;
4.有多云环境(阿里云 / AWS / GCP)使用经验;
5.熟悉作业调度系统或工作流系统设计。