职位描述
1. 深度参与多模态LLM的训练以及效果优化,包括数据工程、模型架构、后训练、上下文工程、解码策略等;
2. 根据业务需求,设计并提供模块化算法系统的技术路线和优化方案,如ContextASR,情绪感知,主流图像大模型的定制化开发等;
3. 与其他团队密切合作,包括数据工程师、后端工程师,实现高质量的项目落地;
4. 跟踪学术界和工业界多模态大模型前沿探索,进行可落地成果转化,推动模型效果达到业界领先的水平,持续提升团队模型的业界竞争力。任职要求
1. 硕士及以上学历,计算机、人工智能、数学等相关专业,博士优先;
2. 有较好的英文科学文献阅读能力,有顶会论文发表经验者优先。熟悉多模态大模型的训练与调优等算法优先;
3. 具备定位和解决问题的能力,掌握模型优化的关键点和常见方法;具备深度学习理论功底,熟悉transformer、ViT、U-Net等模型的技术原理;
4. 了解多模态大模型的技术发展状况和技术栈(模型结构、训练方法、评测方法、数据构建方法等),并有自己的见解;
5. 熟练掌握主流深度学习框架Pytorch,有大模型训练框架Megatron-LM/Deepspeed使用经验者优先;
6. 熟练掌握linux基础命令和操作,能完成集群运行环境的搭建。