职位描述
1.主导公司新一代大模型推理引擎的整体设计与构建,支持多种开源/闭源模型架构,为产品提供高并发、高可靠性和高可扩展性的技术解决方案。
2.对SD/FLUX/WAN等模型进行极致推理加速,显著提升推理效率。
3.通过数据、张量、流水、序列、专家等多维并行化推理、任务调度等分布式优化技术,降低线上推理成本。
4.与业务及算法部门深度协作,推动系统与推理引擎的联合优化,实现产品性能与应用场景的最佳匹配。
5.关注前沿大模型推理技术的预研与引入,不断探索行业新趋势,为公司技术战略提供支持。任职要求
1.基础能力: 计算机相关专业本科及以上学历,具备扎实的计算机基础知识。
2.编程能力: 熟练使用C/C++和Python语言,具备系统软件开发及架构设计经验。
3.技术储备: 深入理解Transformer架构,了解语言和多模态API及调用链,掌握至少一种机器学习推理框架(如TensorRT、vLLM、SGLang、TensorRT-LLM或其他自研框架)。
4.相关背景: 具备机器学习框架、异构并行计算、分布式存储、高性能网络或云计算调度中至少一项的知识和开发经验。
5.性能优化: 熟悉性能建模、性能分析与优化,或拥有CPU/GPU架构相关经验。
6.综合素质: 具有良好的学习、沟通和表达能力,能承受高压力环境,具备团队合作精神。
加分项:
1.熟悉至少一种异构芯片(如NVIDIA、AMD、高通GPU、X86、ARM或国产芯片)的架构特点及软硬件优化策略。
2.熟悉NVIDIA编译优化技术栈底层原理,如cutlass、cute、triton等工具。
3.掌握大模型相关计算优化技术,如FlashAttention、FlashDecoding、计算通信Overlap等。
4.有过DIT架构图像、视频模型推理优化经验的优先。
5.熟悉高性能网络编程,具备InfiniBand、RoCE或高性能Ethernet使用及优化经验。
6.扎实的计算优化理论基础和高性能计算系统优化实践经验。