职位描述1、推理服务部署运维:负责GPU服务器、AI算力集群环境部署调试,管理NVIDIA驱动/CUDA/NCCL/容器工具链版本兼容;基于 vLLM / SGLang / LMCache搭建推理服务,部署 Qwen / DeepSeek / GLM / MiniMax 等主流大模型(单机/多节点),支持私有化内网交付。 2、推理性能优化:评测 TTFT、TPOT、吞吐量、显存占用等指标;设计 TP/PP/DP/EP 并行方案;围绕 KV cache、量化(FP16/BF16/FP8/AWQ/GPTQ/GGUF/INT4/INT8)、长上下文、MoE 路由等方向,持续优化推理吞吐与延迟。 3、工程化交付:完成从裸机环境到模型API的完整交付链路;将推理系统部署进客户受控内网;协同网络工程师调试 NCCL 跨节点通信。 4、文档与监控:输出部署文档、API手册、测试报告、故障复盘;搭建 Prometheus/Grafana 监控体系,实现异常告警与自动恢复。任职要求必备条件: 1、计算机、AI 等相关专业,本科及以上,2年以上 GPU 服务器 / 大模型部署经验。 2、精通 NVIDIA 驱动/CUDA/NCCL/容器工具链的版本兼容管理,能独立解决环境冲突问题。 3、熟悉 vLLM / SGLang 至少一种,理解推理机制——不是只调过 API。 4、熟悉主流量化方案(FP16/BF16/FP8/AWQ/GPTQ/GGUF)。 5、具备独立排查 OOM、CUDA 报错、NCCL 通信异常、推理吞吐低等问题能力。 6、熟悉 Shell/Python,能独立完成裸机到 API 的端到端交付。 7、有生产部署意识,理解受控/离线企业环境与实验室环境的差异。 优先加分项: 1、大模型私有化部署 / 多机分布式推理经验 2、Ray Serve / K8s / Slurm 集群运维经验 3、InfiniBand / RDMA / NCCL / HCCL 多机通信调优经验 4、Prometheus / Grafana 监控体系搭建经验 5、高并发推理服务架构设计经验 6、KV cache 优化 / MoE 推理调优 / MLOps 经验