Ivyea Jobs 6482 roles · 88 companies · 刚刚
MiniMax · 大模型

SRE运维研发工程师-云原生

上海 / 北京 社招 · 全职 AI Infra / 训练系统

职位描述

1. 负责公司 Kubernetes 集群及云原生周边系统的日常运维保障、稳定性建设和自动化工具开发。 2. 深入分析业务在 Kubernetes 集群中的部署、运行、资源使用和性能表现,持续跟踪容量、稳定性及资源效率问题。 3. 结合业务架构、使用场景和发展需求,制定并推动容器化部署、资源配置、调度、弹性伸缩及性能优化等解决方案落地。 4. 与研发团队协作,定位和解决业务运行中的云原生相关问题,沉淀最佳实践、标准规范及平台化能力。 5. 建设和完善可观测性、自动化运维、容量管理和故障应急机制,提升业务系统的可靠性和交付效率。 6. 参与 On-Call 值班,响应线上突发事件,推动问题复盘和长期改进。

任职要求

1. 具备 Kubernetes 生产环境运维经验,熟悉 Docker、Kubernetes 及常见云原生基础组件。 2. 熟悉 Linux、网络、存储等基础知识,具备较强的问题分析、性能定位和故障排查能力。 3. 熟悉监控、日志、告警、服务发现、网络、存储等云原生相关技术或开源方案,并有实际落地经验。 4. 能够理解业务架构和实际使用场景,不局限于基础设施运维,能够从稳定性、性能、容量和资源效率角度提出并推动优化方案。 5. 具备良好的跨团队沟通和协作能力,有较强的责任心、服务意识和问题闭环能力。 加分项 1. 熟悉 Kubernetes 调度机制,具备 Volcano、Kueue 等调度组件的使用或优化经验。 2. 有大规模 GPU 集群、AI 训练/推理业务或批处理任务平台的运维和优化经验。 3. 有资源利用率优化、容量管理、混部、成本治理或 SLO 建设经验。
MiniMax去官方页面投递 →