职位描述
1. 参与大规模预训练模型研发,包括架构设计、训练、微调和推理等环节的系统性研究;
2. 参与面向产品的人工智能算法研发,包括语义理解、自动摘要和自动问答等;
3. 跟踪学术界和工业界前沿技术,推动相关算法在公司项目中实际落地。任职要求
1. 熟练掌握深度学习基础理论和算法,有NLP相关科研/项目经历,熟练掌握Transformer系列模型架构和原理;
2. 精通Python语言,熟练使用PyTorch、TensorFlow等至少一种深度学习框架;
3. 熟悉Megatron-LM、DeepSpeed等至少一种模型训练框架,了解模型并行、流水线并行、数据并行和ZeRO等并行训练技术;
4. 熟悉instruction tuning、prompt tuning等微调算法,了解低参数微调技术;
5. 敢于挑战,追求卓越,有创新精神和研发热情。