职位描述1.负责嵌入式平台(如高通等)上大模型推理性能的深度优化; 2.主导大模型量化方案设计与实现,确保板端部署后的精度对齐; 3.开发和维护高性能 VLA SDK,涵盖模型推理、前后处理及系统级调优; 4.针对 KV Cache 等关键模块进行内存与计算效率优化,提升端侧推理吞吐与延迟表现。任职要求1.精通 C++,具备扎实的嵌入式系统开发经验; 2.熟悉主流开源视觉/语言模型(如 SigLIP、DINO、Qwen 等)的架构与推理流程; 3.深入理解大模型端侧部署全流程,包括 Tokenization、KV Cache 管理、输出后处理等; 4.具备大模型量化(PTQ)实战经验,能完成精度-性能平衡的部署方案。 加分项: 1.有高通平台AI 推理部署或 DSP/NPU 工具链使用经验; 2.熟悉计算图优化技术(如算子融合、图改写、内存复用等); 3.参与过端侧多模态模型(VLM/VLA)SDK 或推理引擎开发。