职位描述
工作职责:
- 基于 Kubernetes 构建稳定、可扩展的大模型训练平台,实现 GPU 算力资源的自动化管理与高效调度。
- 通过自动化手段,保障内部超大规模训练任务的高效运行。
- 优化训练作业调度器,优化拓扑感知、抢占与弹性扩缩容。
- 跟进云原生领域前沿技术,优化云原生异构资源编排。任职要求
- 拥有良好的代码开发习惯,熟练掌握 Golang,具备基础的全栈能力,有代码洁癖者优先。
- 精通 K8s 核心组件(Scheduler, Kubelet, Operator),有生产环境下的大规模集群运维或开发经验。
- 掌握可观测性理念,熟悉 prometheus/ opentelemetry。
- 快速学习能力,能够独立思考和解决问题。
- 良好的团队合作精神和沟通能力。
允许6个月内投递3个职位,请选择适合的职位进行投递
立即投递