Ivyea Jobs 14249 roles · 223 companies · 刚刚
智谱华章 · 大模型

MaaS-SRE / DevOps 工程师

北京 社招 · 全职 训练系统 / 集群 工程开发

职位描述

职位描述 1. 负责 Kubernetes 云原生平台的建设、运维及持续优化,保障业务稳定、安全、高效运行。 2. 负责系统稳定性建设,包括监控、告警、日志、链路追踪等可观测性体系建设,制定监控规范、告警分级及应急响应机制。 3. 参与高可用、高性能、高扩展架构设计,持续优化系统容量、性能及故障恢复能力,推动稳定性治理。 4. 负责 DevOps 平台建设,研发自动化运维工具及平台,持续提升研发交付效率和运维效率。 5. 建设 CI/CD 流水线及发布体系,支持灰度发布、滚动发布、自动回滚等发布能力。 6. 与研发团队协作,推动云原生最佳实践落地,持续优化应用部署、资源管理及运维流程。 7. 负责线上故障应急响应、根因分析(RCA)及故障复盘,推动问题闭环和持续改进。 8. 持续推进基础设施标准化、自动化及平台化建设,降低运维成本,提高系统可靠性。

任职要求

必备条件 1. 本科及以上学历,计算机相关专业,5 年及以上 DevOps、SRE 或平台运维相关工作经验。 2. 熟悉 Linux 操作系统,具备扎实的网络基础(TCP/IP、HTTP、DNS、TLS 等)。 3. 熟悉 Kubernetes、Docker 等容器技术,具备生产环境 Kubernetes 运维及故障排查经验。 4. 熟悉 CI/CD 流程,具有 Jenkins、GitLab CI、Argo CD、Tekton 等至少一种持续交付平台实践经验。 5. 熟练掌握 Go、Python、Bash 至少一种开发语言,具备自动化工具或平台开发能力。 6. 熟悉 Prometheus、Grafana、Alertmanager、Loki、ELK/OpenSearch 等监控日志平台,具备可观测性建设经验。 7. 熟悉 Git、Helm、Kustomize、Terraform、Ansible 等至少部分基础设施自动化工具。 8. 具备较强的问题定位、故障分析及应急处理能力,能够推动稳定性持续优化。 加分项 * 有 Kubernetes 平台开发或 Operator 开发经验。 * 有 Service Mesh(Istio)、Gateway(Ingress Nginx、APISIX、Envoy)实践经验。 * 熟悉云原生生态(CNCF),有平台工程(Platform Engineering)建设经验。 * 有大规模 Kubernetes 集群(百节点以上)运维经验。 * 有 GPU 集群、AI 平台或大模型基础设施运维经验。 * 熟悉 DevSecOps、容器安全、镜像安全相关实践。 * 有混合云、公有云(AWS、阿里云、腾讯云、华为云等)实践经验。 立即投递
智谱华章去官方页面投递 →