职位描述
方向一:
1.推理引擎开发与优化:负责端侧/国产化推理框架(如自研引擎、MNN、VLLM等)的研发与性能调优,支撑LLM、SD、多模态等模型在PC、汽车等终端的高效部署;
2.模型轻量化与压缩:运用量化(PTQ/QAT)、剪枝、蒸馏、稀疏化、KV Cache优化等前沿技术,在保证模型效果的前提下,降低推理延迟、内存占用与硬件功耗;
3.异构算力极致挖掘:针对CPU、GPU、NPU、DSP等不同硬件特性,进行算子开发与优化(如CUDA、OpenCL、NEON指令集),实现异构调度与资源占用优化;
4.端到端落地交付:负责从模型格式转换、工具链开发到业务集成的全链路工作,解决推理卡顿、内存溢出等线上实际问题,协同算法与硬件团队完成交付;
方向二:
1.AI底层技术支持:参与AI算法在端侧或云端的高效部署,为语音、NLP、多模态等AI模型提供底层系统支持与性能优化;
2.系统问题攻坚:解决项目集成中的系统底层难题,如内存管理、进程调度、资源冲突等,保障系统稳定性与实时性;
3.跨部门协作:与算法、产品团队合作,完成从需求分析到版本集成的全流程交付,必要时出差支持客户联调;任职要求
1. 本科及以上学历,计算机、软件工程、电子信息、自动化等相关专业;
2. 具备扎实的 C/C++、数据结构和操作系统基础,理解内存管理、并发编程与编译链接;
3. 有系统软件、推理引擎、编译器、高性能计算或嵌入式相关课程项目、竞赛、科研经历者优先;
4. 具备良好的编码习惯、问题分析能力和团队协作意识。