Ivyea Jobs 5948 roles · 69 companies · 刚刚
摩尔线程 · AI 芯片

AI端侧推理优化工程师

北京 社招 · 全职 AI类 推理 / 部署优化

职位描述

岗位职责 1. 负责端侧大模型推理框架(如vLLM、llama.cpp、MNN等)的性能优化与加速,提升吞吐与降低延迟。 2. 负责端侧语音、Embedding、OCR、AIGC、自动驾驶等模型在推理框架(如ONNXRuntime、MNN等)中的性能调优与部署适配。 3. 与算子团队、编译器团队紧密协作,共同完成端侧高性能推理框架的集成、验证与交付。 4. 深入分析推理链路性能瓶颈,设计并实现系统级优化方案,推动框架在真实场景中的高效稳定运行。

任职要求

任职要求 1. 精通核心框架:熟练掌握vLLM、llama.cpp、ONNXRuntime等至少一种主流推理框架的架构、工作机制与源码。 2. 掌握大模型优化技术:熟练掌握大模型推理的关键加速方法与技术(如Flash Attention、Paged Attention、Speculative Decoding、Continuous Batching等),并具备实际应用经验。 3. 具备系统级优化能力:熟练使用Triton或Cutlass等工具开发与优化高性能GPU Kernel,精通CUDA编程、内存管理与性能优化方法论,并有重要项目落地经验。 4. 精通性能剖析工具:熟练掌握性能剖析工具(如PyTorch Profiler、Nsight Systems、Nsight Compute等),并具备使用CUDA Graph、Torch AOT等高级优化技术进行深度调优的经验。 5. 具备协同交付能力:责任心强,具备优秀的沟通与协作能力,能够协同算法、编译、硬件等多团队完成端到端技术交付与落地。 加分项 1. 有一线互联网公司或头部AI企业推理引擎优化与大规模业务落地经验。 2. 在推理框架技术基础上,深入掌握算子优化、编译器优化(如MLIR、TVM)或GPU硬件架构知识。 3. 具备端侧模型量化(如W4A16、W4A8等)调优及部署实践经验。