职位描述
岗位定位
负责大语言模型(LLM)的工程化落地、部署优化、推理加速及服务架构搭建,解决模型生产环境中的高并发、低延迟、高可用问题,推动LLM技术从研发到规模化应用的落地,支撑业务线LLM能力接入与迭代。
岗位职责
负责LLM的本地化部署、微调与推理优化,搭建高效、稳定的LLM推理服务,优化模型响应速度,可用性以及资源利用率。
主导LLM模型工程化优化,包括模型量化(INT4/INT8)、剪枝、蒸馏等压缩技术落地,平衡模型性能与推理精度,适配不同部署场景。
设计并实现LLM服务平台架构,基于vLLM、SGLang、llamacpp等工具搭建多模型统一调用接口,支持动态负载均衡、弹性伸缩,保障服务有限资源下的高可用。
熟悉vLLM、SGLang、llama.cpp等不同推理框架,能够推动KV Cache 优化、连续批处理、异构硬件适配(GPU/CPU)、显存Offloading相关技术的产品化工作。
了解不同评测模式,匿名对战、Elo 评分、多轮开放式评测,设计并建立针对智能体的合理的客观 / 主观结合的评估标准。任职要求
学历要求:本科及以上学历,计算机科学与技术、人工智能、软件工程、电子信息等相关专业,1-3年及以上LLM工程化相关工作经验(优秀应届生可放宽)。
核心技术:精通大语言模型的部署与推理优化,熟悉Transformer架构原理,掌握至少一种LLM推理框架(vLLM、SGLang、llamacpp等),有模型量化、剪枝等优化经验者优先。
工程能力:熟练掌握Python、C++(核心推理优化),熟悉PyTorch/TensorFlow框架;具备Docker容器化、Kubernetes(K8s)集群部署与运维经验,了解微服务、分布式系统架构。
软技能:具备良好的需求拆解、逻辑思维与跨团队协作能力,能快速适配业务场景;对LLM工程化领域有强烈兴趣,愿意主动学习前沿技术,具备较强的抗压能力与执行力。
立即投递