职位描述
岗位职责:
1. 负责计算集群基础架构设计和开发工作;
2. 基于k8s构建对应CPU,GPU机器集群调度系统,方便用户快速地申请资源开展各类机器学习任务;
3. 设计任务、资源监控系统,保证平台稳定、可靠易维护;
4. 熟悉GPU虚拟化,自动扩缩容节点,集群调度任务流pipeline等有关开发工作;
5. 熟悉k8s相关存储插件、网络插件、网关等组件的性能监控、评估及调优。任职要求
1. 本科及以上学历,计算机、人工智能等相关专业优先;
2. 熟悉Kubernetes、Docker等工具,熟练掌握Go、Python、Linux shell;
3. 有AlInfra资源、任务调度研发经验。熟悉AI加速卡任务运行、容错、调度特性,有大模型集群调度、训练稳定性调整的经验;
4. 熟悉ROCEv2,有异构AI加速卡组网研发调优经验优先;
5. 敢于创新,勇于尝试,能够在不确定性中保持战略定力,推动产品不断突破和优化。
立即投递