职位描述
岗位职责:
- 负责云上及外租机房 GPU 推理训练集群、在线业务的基础设施建设与稳定性保障
- 负责 GPU 集群自动化运维、监控、告警、自愈及高可用能力建设
- 负责资源 ROI / FinOps 体系建设,持续提升 GPU、CPU、存储及网络资源利用率
- 参与 AI 基础设施平台工程化、自动化与运维效率体系建设任职要求
基本要求:
- 1 年以上 SRE / 基础设施 / 后端研发相关经验
- 一定的计算机基础(操作系统、网络、数据结构、分布式系统)
- 具备较强的问题分析与故障定位能力
技术能力:
- 熟悉 Kubernetes / Prometheus / 容器 / GPU 推理训练技术栈
- 熟悉 Linux 系统原理以及排障、优化手段
- 熟练掌握 Go / Java / Python 至少一种语言
- 有大型分布式系统的运维经验,理解高并发、高可用设计
- 具备自动化运维、监控与可观测性体系建设经验
加分项:
- 大规模 Kubernetes 或 GPU 集群(百节点以上)运维/开发经验
- 丰富的 ROI / FinOps / 资源运营体系建设经验
- 熟悉 AI 推理平台、训练平台相关技术栈
- 熟练具备 Vibe Coding 使用能力
- 有 AI Infra、云平台或大规模分布式系统相关经验优先