Ivyea Jobs 14249 roles · 223 companies · 刚刚
智谱华章 · 大模型

SRE运维工程师

北京 社招 · 全职 工程研发 训练系统 / 集群 工程开发

职位描述

岗位职责: 负责面向全球ToC的业务稳定性建设,包括但不限于Web服务、APP后端、API网关、云基础设施、安全 负责线上业务服务7x24小时运维保障,及时定位处理业务故障,快速恢复应用服务 配合研发团队完成业务架构选型、应用部署、版本发布、监控接入、链路调优及日常维护 负责Kubernetes集群的建设与稳定性保障,包括版本升级、故障排查、性能调优、资源利用率优化 负责设计基于云平台基础设施的高可用架构,保障基础设施、中间件、业务服务的稳定性 负责云平台资源生命周期管理及成本优化 主导容器化架构调优(如Pod调度策略、网络插件选型、存储方案设计),优化资源请求/限制配置以减少资源争用。 建立容器安全防护体系,包括漏洞扫描、运行时安全监控(如Falco)、合规审计。 深度参与自动化运维工具链建设,CI/CD流水线、混沌工程测试、智能扩缩容(HPA/VPA)。 负责开源监控体系建设及维护(prometheus/victoriametirc),推动AIOps落地,基于时序数据分析预测集群负载并实现自愈。 解决生产环境疑难问题(如OOM、网络延迟、存储性能瓶颈),输出标准化SOP文档。 协同研发团队优化微服务架构,推动ServiceMesh等新技术落地。 私服、比如nexus、gitlab、harbor等工具大并发下的运维经验

任职要求

1.教育背景 计算机、软件工程、云计算相关专业优先。 2.工作经验 -5年以上容器运维经验,主导或深度参与过万级Pod规模的集群维护。 -熟悉生产环境容器化全生命周期管理,包括部署、监控、扩缩容、故障恢复等场景。 -有多云环境/混合云管理经验 -有过安全相关工作经验优先 -头部互联网/云计算大厂优先 3.技术能力 -精通Kubernetes架构及生态工具(如Etcd、Calico、Istio),具备集群性能调优经验(如APIServer负载均衡、节点调度优化)。 -熟练使用Docker、Prometheus、Grafana、ELK、CI/CD等工具链,熟悉云原生安全体系(如镜像扫描、RBAC策略、网络策略)。 -具备基于云基础设施的运维、架构经验。 -具备运维开发能力,能使用Python/Go开发自动化工具(如自定义Operator、监控告警脚本)。 立即投递
智谱华章去官方页面投递 →