职位描述
职位描述
1. 负责 Kubernetes 云原生平台的建设、运维及持续优化,保障业务稳定、安全、高效运行。
2. 负责系统稳定性建设,包括监控、告警、日志、链路追踪等可观测性体系建设,制定监控规范、告警分级及应急响应机制。
3. 参与高可用、高性能、高扩展架构设计,持续优化系统容量、性能及故障恢复能力,推动稳定性治理。
4. 负责 DevOps 平台建设,研发自动化运维工具及平台,持续提升研发交付效率和运维效率。
5. 建设 CI/CD 流水线及发布体系,支持灰度发布、滚动发布、自动回滚等发布能力。
6. 与研发团队协作,推动云原生最佳实践落地,持续优化应用部署、资源管理及运维流程。
7. 负责线上故障应急响应、根因分析(RCA)及故障复盘,推动问题闭环和持续改进。
8. 持续推进基础设施标准化、自动化及平台化建设,降低运维成本,提高系统可靠性。任职要求
必备条件
1. 本科及以上学历,计算机相关专业,5 年及以上 DevOps、SRE 或平台运维相关工作经验。
2. 熟悉 Linux 操作系统,具备扎实的网络基础(TCP/IP、HTTP、DNS、TLS 等)。
3. 熟悉 Kubernetes、Docker 等容器技术,具备生产环境 Kubernetes 运维及故障排查经验。
4. 熟悉 CI/CD 流程,具有 Jenkins、GitLab CI、Argo CD、Tekton 等至少一种持续交付平台实践经验。
5. 熟练掌握 Go、Python、Bash 至少一种开发语言,具备自动化工具或平台开发能力。
6. 熟悉 Prometheus、Grafana、Alertmanager、Loki、ELK/OpenSearch 等监控日志平台,具备可观测性建设经验。
7. 熟悉 Git、Helm、Kustomize、Terraform、Ansible 等至少部分基础设施自动化工具。
8. 具备较强的问题定位、故障分析及应急处理能力,能够推动稳定性持续优化。
加分项
* 有 Kubernetes 平台开发或 Operator 开发经验。
* 有 Service Mesh(Istio)、Gateway(Ingress Nginx、APISIX、Envoy)实践经验。
* 熟悉云原生生态(CNCF),有平台工程(Platform Engineering)建设经验。
* 有大规模 Kubernetes 集群(百节点以上)运维经验。
* 有 GPU 集群、AI 平台或大模型基础设施运维经验。
* 熟悉 DevSecOps、容器安全、镜像安全相关实践。
* 有混合云、公有云(AWS、阿里云、腾讯云、华为云等)实践经验。
立即投递