职位描述1、负责端侧推理框架的迭代、NPU适配与落地优化,聚焦嵌入式/车载边缘NPU平台,专注大模型(LLM/VLM)端侧部署场景,保障模型推理高效、稳定运行。 2、负责推理框架核心能力定制开发与性能优化,涵盖模型解析、计算图优化、内存/推理调度、量化推理适配等核心模块,解决端侧设备算力有限、显存受限、时延敏感等大模型落地核心问题。 3、对接大模型量化与轻量化流程,适配PTQ、QAT量化方案及剪枝、蒸馏、稀疏化等压缩技术,平衡大模型端侧推理精度与性能。 4、主打端侧NPU平台适配调优,针对各类大模型、Transformer架构模型,完成推理框架移植适配、访存优化、推理策略迭代,持续提升推理吞吐、降低推理时延与内存占用。 5、搭建端侧大模型推理性能、精度、稳定性评测体系,持续优化显存占用、推理延迟、功耗等核心指标,支撑大模型规模化端侧落地交付。 6、跟进端侧大模型推理前沿技术,落地轻量化、高性能推理优化方案,持续提升推理框架在各类NPU平台的兼容性与推理性能。任职要求1、本科及以上学历,计算机、人工智能、电子信息、软件工程等相关专业,具备扎实的计算机基础与C/C++编程功底。 2、精通TensorRT-Edge-LLM 、TensorRT、MNN核心原理与二次开发,熟悉主流端侧推理框架,具备推理框架定制改造、性能优化、功能迭代的实战经验。 3、熟练掌握Transformer架构,深入理解大模型基础原理与端侧部署逻辑,具备大模型轻量化、推理优化、端侧落地实操经验。 4、熟悉端侧NPU异构架构与适配逻辑,具备推理框架跨NPU平台移植、计算图优化、内存调度优化经验。 5、熟悉PTQ、QAT量化原理与落地流程,能够独立排查大模型量化精度丢失、推理异常、显存溢出等问题,保障模型顺利落地。 6、具备良好的问题排查能力与主动学习意识,沟通协作顺畅,可高效配合算法团队完成大模型端侧部署与迭代交付。 加分项 1、精通大模型推理框架vllm、sglang。 2、具备LLM/VLM多模态大模型在边缘NPU平台的适配、移植与深度性能调优经验,可独立解决大模型推理时延高、显存占用大、稳定性差等落地难题。 4、熟悉大模型端侧压缩、稀疏化、推理调度、上下文优化方案,有复杂大模型轻量化落地实战经验。 5、熟悉主流端侧NPU硬件架构与推理特性,针对大模型场景完成过推理框架专项优化,具备规模化部署落地经验。