职位描述
1. 端侧语言模型 / 多模态模型 / 全模态模型推理部署;
2. 深入全模态模型双工异步工作流推理开发与优化;
3. 模型量化、KV Cache 管理与投机推理加速;
4. 分析硬件性能调优与内存管理;
5. 跟进主流芯片厂商技术栈演进;任职要求
1. 了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen、Whisper 等,能分析其计算与内存特点;
2. 熟悉TensorRT,了解llama.cpp、vllm、sglang框架;
3. 有Orin平台开发经验;
4. 了解投机采样(Eagle2/Eagle3/MTP)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;
5. 精通 C/C++/python;
6. 具备 异步多线程计算、内存管理优化 实战经验;
7. 熟悉 GPU OOM / 内存调优,能分析内存带宽与计算瓶颈;
加分项:
1. 有Whisper、Qwen3 asr等声学模型推理开发经验;
2. GPU kernel / OpenCL / 自定义推理算子实现经验;
3. Openvino推理开发经验;
4. llama.cpp 自定义推理 runtime 开发经验;
5. 有模型压缩、量化、蒸馏技术经验;