Ivyea Jobs 5947 roles · 66 companies · 刚刚
自变量机器人 · 具身智能

AI平台SRE工程师

深圳 社招 · 全职 AI Infra / 训练系统

职位描述

岗位职责 1. 负责 AICP 在云和 Kubernetes 上的可用性、性能、容量和灾备。 2. 建立 SLI/SLO、错误预算、告警、值班、事故指挥和复盘机制。 3. 负责 PostgreSQL 高可用、备份、PITR、恢复演练、性能和升级。 4. 负责 APISIX、Ingress、魚载均衡、DNS、TLS、路由、限流和流量切换。 5. 维护应用、微服务、外部依赖、日志、指标和追踪体系。 6. 维护 CI/CD、GitOps、生产发布、数据库迁移、配置和密钥变更。 7. 负责云资源运行、成本与容量,并通过IT流程使用RAM、VPC、DNS 和安全能力。 8. 推动研发补齐幂等、超时、降级、对账和可观测性。

任职要求

任职要求 1. 5年以上 SRE、云平台或后端生产运维经验,3年以上 Kubernetes生产经验。 2. 深入理解 Linux、TCP/P、HTTP、DNS、TLS、热载均衡和微服务故障模式。 3. 熟悉 PostgreSQL 备份恢复、复制、连接、锁、索引、VACUUM 和性能分析。 4. 熟悉 Prometheus/Grafana、SLS/ELK、OpenTelemetry 中至少两类。 5. 熟悉 APISIX、Nginx、Envoy 或云网关中的一类,理解灰度、限流和熔断。 6. 熟悉阿里云 VPC、RAM、ACK、RDS/自建数据库、OSS、SLS、负载均衡和 DNS。 7. 能够使用 Terraform、Ansible、Helm、Kustomize、GitOps 或同类工具进行自动化。 8. 具备生产事故、变更、容量、灾备和跨团队沟通经验。