职位描述1. 负责公司 Kubernetes 集群及云原生周边系统的日常运维保障、稳定性建设和自动化工具开发。 2. 深入分析业务在 Kubernetes 集群中的部署、运行、资源使用和性能表现,持续跟踪容量、稳定性及资源效率问题。 3. 结合业务架构、使用场景和发展需求,制定并推动容器化部署、资源配置、调度、弹性伸缩及性能优化等解决方案落地。 4. 与研发团队协作,定位和解决业务运行中的云原生相关问题,沉淀最佳实践、标准规范及平台化能力。 5. 建设和完善可观测性、自动化运维、容量管理和故障应急机制,提升业务系统的可靠性和交付效率。 6. 参与 On-Call 值班,响应线上突发事件,推动问题复盘和长期改进。任职要求1. 具备 Kubernetes 生产环境运维经验,熟悉 Docker、Kubernetes 及常见云原生基础组件。 2. 熟悉 Linux、网络、存储等基础知识,具备较强的问题分析、性能定位和故障排查能力。 3. 熟悉监控、日志、告警、服务发现、网络、存储等云原生相关技术或开源方案,并有实际落地经验。 4. 能够理解业务架构和实际使用场景,不局限于基础设施运维,能够从稳定性、性能、容量和资源效率角度提出并推动优化方案。 5. 具备良好的跨团队沟通和协作能力,有较强的责任心、服务意识和问题闭环能力。 加分项 1. 熟悉 Kubernetes 调度机制,具备 Volcano、Kueue 等调度组件的使用或优化经验。 2. 有大规模 GPU 集群、AI 训练/推理业务或批处理任务平台的运维和优化经验。 3. 有资源利用率优化、容量管理、混部、成本治理或 SLO 建设经验。