职位描述
平台设计与开发: 参与设计、开发和维护公司统一的机器学习平台,涵盖从模型开发、模型训练、评估到部署监控的全生命周期。
分布式训练系统优化: 研发和优化支持大规模分布式训练(如PyTorch DDP, FSDP等)的底层系统,提升GPU集群利用率和训练效率。
训练任务稳定性保障:研发稳定性保障的工具和平台集成,包括故障检测以及故障自动化容错等能力。
资源调度与云原生集成: 基于Kubernetes生态优化基于GPU等异构资源的调度策略和弹性伸缩能力。任职要求
计算机科学、软件工程或相关专业本科及以上学历,3年以上相关领域开发经验。
扎实的计算机基础,精通Python/Go中的至少一门语言,具备优秀的系统设计、编码和调试能力。
熟悉PyTorch 的基本原理和内部机制,能解决常见的训练框架问题
深入理解机器学习工作流,对模型开发、训练、评估、部署的痛点有深刻认识。
熟悉Docker、Kubernetes,有在云原生环境下开发和部署服务的经验。
具备良好的团队协作精神和沟通能力,有强烈的责任心和自驱力。