职位描述1.负责云原生平台的日常运维与监控,建立涵盖日志、指标、追踪(Observability)的可观测性体系。 2.设计和维护 CI/CD 流水线,推动 GitOps 及自动化部署、自动化测试与自动回滚机制的落地。 3.处理云平台复杂故障与性能瓶颈,制定应急预案,持续提升系统 SLA。任职要求1.精通 Linux 操作系统及 Shell/Python 脚本编写,具备极强的故障排查能力。 2.熟练使用 Prometheus、Grafana、ELK/Loki、Jaeger 等监控与日志工具。 3.熟悉 Jenkins、GitLab CI、ArgoCD 等自动化运维工具链。 4.具备 SRE 理念,有大规模 K8s 集群稳定性保障经验者优先。