职位描述
1、负责基于自研GPU平台适配PyTorch、TensorFlow、Paddle等主流AI框架;
2、负责开发和优化分布式大模型并行策略,提升大模型的推理和训练性能和效率;
3、负责定位和分析模型推理和训练中的性能瓶颈,并优化相应的框架和算子实现。任职要求
1、计算机相关专业,本科及以上学历, 1-3年相关工作经验;
2、熟悉C/C++编程,有扎实的编程基础和较强的问题解决能力;
3、熟悉至少一种异构计算编程体系,如:CUDA、HIP、SYCL、OpenCL等;
4、熟悉DeepSpeed/Megatron-LM/ColossalAI等分布式训练框架;
5、熟悉多卡通信和分布式计算的相关原理、常见的大规模分布式并行计算策略;
6、有很好的团队协作能力与沟通能力,对技术和代码品质有追求;
7、熟悉PyTorch/Tensorflow等AI框架且有大规模训练实践经验者优先;
8、熟悉vLLM/TensorRT-LLM等大语言模型推理框架者优先。