职位描述
1. 负责公司大模型推理系统的端到端适配与调优工作;
2. 针对大模型推理系统运行过程中出现的功能性、稳定性、以及性能异常问题进行定位与解决;
3. 针对公司自研 GPU 架构优化大模型推理系统任职要求
任职资格
1. 3 年及以上相关工作经历;
2. 优秀的代码能力、数据结构和基础算法功底,熟练 C/C++ 或 Python;
3. 熟悉至少一种主流的机器学习框架,如 PyTorch;
4. 熟悉至少一种主流的大模型推理框架,如 SGLang、vLLM 等;
5. 熟悉大模型服务部署及优化技术,例如动态 batching、投机预测、负载均衡等;
6. 熟悉大模型推理系统的 profile 工具使用与性能分析方法;
7. 熟悉至少一种大模型的结构,如 DeepSeek、Llama 等;
8. 熟悉 GPU 分布式推理中的常见通信原语;
9. 掌握分布式推理并行策略,包括 TP、PP、EP 等;
10. 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;
11. 良好的沟通协作能力,能和团队一起探索新技术,推进技术进步;
加分项
1. 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;
2. 有以下某一方向领域的经验:GPU kernel 开发(不限于 cuda、tilelang、triton),RDMA,AI Infrastructure,HW/SW Co-Design,Distributed Storage,k8s 部署;
3. 在大模型领域,参与过大影响力的项目或论文者优先;
4. 有软硬协同优化经验者优先;