Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

【共创】Kubernetes 运维工程师

上海 社招 · 外包 AI Infra / 训练系统

职位描述

负责公司 Kubernetes 集群的规划、部署、升级、监控与高可用保障,支撑数百节点规模的生产环境; 设计并实施安全、稳定、高效的 CI/CD 流水线,集成 GitOps(如 Argo CD)、Helm、Kustomize 等工具; 优化集群资源利用率,通过 HPA/VPA、Cluster Autoscaler、Cost Allocation 等手段实现成本可控; 构建可观测性体系:基于 Prometheus + Grafana + Loki + Tempo 实现日志、指标、链路追踪一体化监控; 制定并落地 K8s 安全策略:包括 Pod Security Admission、NetworkPolicy、RBAC、镜像扫描、运行时安全(Falco)等; 支持多云/混合云架构(AWS EKS / Azure AKS / 阿里云 ACK / 自建集群),实现跨环境一致性管理; 编写自动化脚本(Python/Go/Bash)和基础设施即代码(IaC)模板(Terraform/Ansible); 响应 P0/P1 级故障,主导根因分析(RCA),推动系统健壮性提升; 沉淀最佳实践,输出技术文档,赋能开发团队自助使用 K8s 平台。

任职要求

3 年以上生产环境 K8s 集群管理经验; 深入理解 Kubernetes 核心组件(etcd, kube-apiserver, scheduler, controller-manager, CNI, CSI); 熟练掌握 Helm、Kustomize、Argo CD 等声明式部署工具; 精通至少一种主流云平台(AWS/Azure/GCP/阿里云)的容器服务; 熟悉 Prometheus 监控体系及告警规则配置; 具备扎实的 Shell/Python 脚本能力,能快速开发运维工具; 熟悉 Docker 容器原理、镜像构建优化及安全扫描; 具备良好的故障排查能力,能熟练使用 kubectl, crictl, tcpdump, perf 等工具。 加分项 有大规模 K8s 集群(500+ 节点)调优经验; 熟悉 Service Mesh(Istio/Linkerd)或 Serverless(Knative); 参与过 CNCF 开源项目或持有 CKA/CKAD/CKS 认证; 了解 eBPF、Cilium、Calico 等高级网络方案; 有 GitOps、FinOps 或混沌工程实践经验; 熟悉 Operator 开发或自定义 Controller。