Ivyea Jobs 8332 roles · 120 companies · 刚刚
面壁智能 · 大模型

端侧大模型推理工程师

北京 社招 · 全职 推理 / 部署优化

职位描述

负责在异构端侧上落地大模型与多模态推理系统,深入底层系统、GPU/NPU/CPU 异构计算,优化模型推理性能,解决实际使用过程中的长尾问题,确保模型推理在端侧高效、稳定运行。 工作内容包括: 1、端侧语言模型 / 多模态模型推理部署; 2、异构硬件性能调优与内存管理; 3、推理框架、工具链、跨平台构建系统开发与优化; 4、模型量化、KV Cache 管理与端侧推理优化; 5、跟进前沿模型架构(如 Transformer 及其衍生变体、投机解码加速技术 EAGLE 系列等)的迭代演进。

任职要求

1、了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen等,能分析其计算与内存特点; 2、熟悉至少一种端侧推理框架(llama.cpp / TensorRT / QNN / ONNX Runtime); 3、了解投机采样(Speculative Decoding / Sampling)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响; 4、精通 C/C++/python; 5、熟悉 mmap / CMA / GPU OOM / 内存调优,能分析内存带宽与计算瓶颈并进行仿存与计算逻辑优化。 加分项: 1、有CUDA / OpenCL / 自定义推理算子实现经验; 2、有 Android NDK / aarch64 交叉编译经验; 3、有MoE模型开发经验; 4、Orin平台开发经验; 5、有模型压缩、量化、蒸馏技术经验优先。
面壁智能去官方页面投递 →