职位描述
1、负责大模型训练和推理系统的设计研发和性能优化,解决系统高并发、高可靠性、高可扩展性等技术难题,包括但不限于超大模型计算性能优化、超大规模集群训练调优、分布式推理系统、大规模推理流量调度等;
2、与算法、产品团队深度合作,为业务场景进行算法与系统的联合优化。任职要求
1、优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI等比赛获奖者优先;
2、熟练至少一种主流的机器学习框架(TensorFlow / PyTorch),熟悉大模型相关算法结构,如Transformer、DiT等;
3、掌握分布式系统原理,参与过大规模分布式系统的设计、开发和维护;
4、工作责任心强,学习能力强、沟通协作能力强,富有自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、在大模型领域,参与过大影响力的项目或论文者优先;
2、有以下某一大模型训练/推理框架的经验:Megatron-LM、DeepSpeed、vLLM、TensorRT-LLM、LMDeploy等。