职位描述
负责在异构端侧上落地大模型与多模态推理系统,深入底层系统、GPU/NPU/CPU 异构计算,优化模型推理性能,解决实际使用过程中的长尾问题,确保模型推理在端侧高效、稳定运行。
工作内容包括:
1、端侧语言模型 / 多模态模型推理部署;
2、异构硬件性能调优与内存管理;
3、推理框架、工具链、跨平台构建系统开发与优化;
4、模型量化、KV Cache 管理与端侧推理优化;
5、跟进前沿模型架构(如 Transformer 及其衍生变体、投机解码加速技术 EAGLE 系列等)的迭代演进。任职要求
1、了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen等,能分析其计算与内存特点;
2、熟悉至少一种端侧推理框架(llama.cpp / TensorRT / QNN / ONNX Runtime);
3、了解投机采样(Speculative Decoding / Sampling)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;
4、精通 C/C++/python;
5、熟悉 mmap / CMA / GPU OOM / 内存调优,能分析内存带宽与计算瓶颈并进行仿存与计算逻辑优化。
加分项:
1、有CUDA / OpenCL / 自定义推理算子实现经验;
2、有 Android NDK / aarch64 交叉编译经验;
3、有MoE模型开发经验;
4、Orin平台开发经验;
5、有模型压缩、量化、蒸馏技术经验优先。