职位描述
负责语音助手、AI 问答、Agent、多模态等大模型的部署、上线及线上稳定性保障。
负责 vLLM、SGLang、TensorRT-LLM 等推理框架的部署与性能优化,提升吞吐、降低推理成本。
参与 GPU 集群及 AI Infra 建设,基于 Kubernetes、Docker 等技术搭建自有大模型推理基础设施。
负责模型量化、显存优化、推理加速等工作,持续提升 GPU 利用率和服务性能。
负责线上服务的监控、故障排查及稳定性优化,协同算法团队完成模型压测和上线。任职要求
本科及以上学历,计算机相关专业。
熟悉 Linux、Python/Shell、Docker、Kubernetes,有 GPU 集群或 AI Infra 相关经验。
熟悉 vLLM、SGLang、TensorRT-LLM、LMDeploy 等一种或多种推理框架,有实际部署经验。
理解 Transformer、大模型推理流程及 GPU 加速原理,有推理性能优化经验优先。
具备较强的线上问题排查和自动化运维能力。
有大模型、高并发 AI 服务、语音 AI、多模态或智能硬件经验优先。