职位描述
1. 研究大模型在CPU/GPU/NPU异构计算平台上的部署和优化;
2. 负责端侧设备上部署大模型,并进行性能优化,提升推理效率,降低成本,提升用户的使用体验;
3. 负责LLMs大模型训练框架优化及效率提升,提高算法迭代训练效率,降低成本。任职要求
1. 计算机相关学科硕士及以上学历;
2. 熟悉C++、Python等编程语言,5年以上C++开发经验;
3. 熟悉深度学习框架 Pytorch、JAX;
4. 熟悉AI编译器与AI工具链,如MLIR/Triton/XLA优先;
5. 扎实的深度学习基础,熟悉常见神经网络架构与算法,具备AI模型开发经验;
6. 熟练掌握主流AI模型结构和应用,精通大模型优化技术,如量化、蒸馏、压缩、剪枝等;
7. 具有丰富的NPU、GPU等边缘计算设备上大模型部署与优化经验,至少熟悉一种推理框架,如llama.cpp、vllm、sglang等;
8. 有很好的团队协作能力与沟通能力,对技术和代码品质有追求。