职位描述
1.支持万卡集群分布式训练性能稳定性优化,和精度对齐
2.针对具体训练模型,拆解优化算法,达成性能优化目标
3.研究适配优化常见分布式训练框架
4.研究和实现前沿大模型性能优化算法任职要求
1. 数学/自动化/计算机/软件/通信等专业
2. 对新算力设备/国产算力设备和 AI 领域研究抱有兴趣
3. 对深度学习和分布式优化方向的基本算法有较好的理解,具有大规模集群训练和调优经验
4. 具备扎实的编程、代码阅读及调试能力
5. 熟悉 PyTorch;了解大模型框架,如 megatron、deepspeed、colossalai、fsdp 等
6. 了解稠密、稀疏、多模态模型训练和推理算法
加分项:
- 具有较强的科研能力,曾在顶级会议发表论文
- 有竞赛刷榜经历或 ACM 竞赛获奖经历