职位描述岗位职责 1. 负责LLM从预训练模型到边缘推理服务的完整集成与落地,搭建LLM服务化CI/CD流水线,实现模型量化、编译优化、前后处理标准化和推理服务一键部署。 2. 设计开发边缘LLM推理服务流水线,支持主流推理引擎(SGLang、vLLM、Nano-LLM)的自动集成、性能测试、服务封包、版本发布,保障模型在边缘设备上的稳定运行。 3. 针对边缘设备资源受限场景,设计并实现模型量化压缩方案(AWQ、GPTQ、GGUF/INT4/INT8),优化模型推理延迟与内存占用,确保在Jetson Nano/Xavier等边缘设备上的高效运行。 4. 开发模型微调(Fine-tune)标准化流程,支持基于LoRA/QLoRA的参数高效微调,实现数据预处理、训练、评估、部署的全流程自动化。 5. 开发业务方常用的压测、回测、精度排查、服务调用等功能工具,提供性能监控、日志追踪、错误诊断等运维能力,保障LLM服务在边缘环境的高可用性。任职要求1. 计算机相关专业本科及以上,3年以上AI模型部署或边缘计算开发经验 2. 精通Python/C++,熟悉PyTorch、Transformers框架,了解HuggingFace生态 3. 熟练掌握SGLang、vLLM、Nano-LLM等LLM推理引擎的原理与使用,有实际部署经验 4. 深入理解模型量化技术(AWQ、GPTQ、GGUF等),有端侧模型压缩实战经验 5. 熟悉LoRA、QLoRA等参数高效微调技术,有实际fine-tune项目经验 加分项 1. 熟悉Jetson系列设备(Nano/Xavier/Nova)的开发与优化 2. 有DeepSeek、Qwen、Llama系列模型的部署调优经验 3. 熟悉SGLang的RadixAttention机制和结构化生成(structured generation) 4. 有Agent系统开发经验,了解多步骤推理流程 5. 有模型服务化(Model-as-a-Service)平台建设经验 6. 熟悉Medusa、EAGLE等加速推理框架