职位描述
1. 负责公司核心业务系统的稳定性保障,包括7×24小时故障响应、系统监控、性能调优与容量规划;
2. 主导运维自动化平台的建设与优化,包括CI/CD、配置管理、监控告警、日志分析等系统;
3. 负责云平台(Kubernetes)的部署、运维与调优,保障微服务架构下的高可用性;
4. 参与腾讯云、阿里云等主流云厂商的资源规划、部署,以及成本量化;
5. 制定并推动运维规范、流程与标准,提升团队整体交付效率与质量;
6. 快速定位并解决复杂系统问题,推动告警自愈、故障演练、应急响应机制落地。任职要求
1. 本科及以上学历,计算机相关专业,5年以上大型系统运维经验;
2. 精通Linux操作系统,了解Linux操作系统、存储、网络IO等相关原理;
3. 熟悉Docker、Kubernetes等容器技术,具备实际生产环境运维经验;
4. 熟悉DevOps、CI/CD工具链(如 Jenkins、GitLab CI等);
5. 熟悉自动化运维工具(如 Ansible、SaltStack、Terraform);
6. 熟悉监控体系(如 Prometheus、Grafana、Zabbix、ELK);
7. 熟悉MySQL、Redis、MongoDB、Tidb等数据库、熟悉常见数据库优化技术
8. 熟悉至少一种编程语言(如 Python/Go/Shell),具备脚本能力;
9. 积极拥抱AI化的运维与运维开发,在AI化的告警、问题排查、CICD流程、运维平台开发维护等方向有实际经验。
10. 具备良好的沟通能力、团队协作意识与抗压能力;
11. 责任心强,追求效率,有良好的对外沟通能力、协作能力、学习能力与抗压能力;
12. 必须有云平台(阿里云/腾讯云)运维经验。
其他:有GPU AI相关运维经验、大型分布式系统、高并发场景运维经验者优先。