职位描述
1.基于自研芯片开发高性能训练框架,如基于 Megatron-LM / Megatron-Core 等进行;
2.适配并深度优化主流分布式框架,如LLaMA、GPT、MoE 等大模型在自研芯片上的跑通、精度验证、性能优化与稳定性提升;
3.开发与优化混合并行及内核级策略;
4.调研前沿技术,实现超大规模分布式,跟踪 Megatron、PyTorch、DeepSpeed 等主流框架动态;
5.协同上下游解决分布式性能与精度问题;任职要求
1.计算机等相关专业本科及以上,硕士优先,精通Python/C++;
2.具备分布式系统、HPC或深度学习框架项目经验,熟悉 PyTorch 训练流程及 Transformer 原理;
3.深入理解大模型分布式并行策略及主流模型架构,深入理解 TP/PP/DP/CP 等分布式训练机制。;
4.熟悉集合通信原语,有CUDA/异构计算编程经验者优先;
5.有大规模分布式系统或机器学习平台开发经验者优先;
6.熟练使用Profiler等工具进行系统级瓶颈定位者优先;