职位描述
负责大模型推理平台架构设计、性能优化与集群建设,聚焦多模型调度、PD 分离、高并发保障及成本管控;要求具备 vLLM/TensorRT-LLM 等引擎源码经验,精通 CUDA、分布式并行与 KV 缓存,熟悉 K8s 及 GPU 调度,工作直接决定 AI 产品体验与商业化竞争力。任职要求
必备条件
1、推理引擎能力:对 vLLM、TensorRT-LLM、SGLang、TGI 中至少一个引擎有源码级理解和二次开发经验,能独立修改核心调度器、调优缓存机制与并行策略,熟练使用 nsys、ncu 等工具进行端到端性能剖析。
2、GPU 优化能力:精通 CUDA 编程模型、NCCL 通信原语、NVLink/PCIe 总线特性和 HBM 内存架构,掌握CUDAGraph、Kernel 融合、内存带宽优化等技术,能运用 Roofline 模型定位系统瓶颈。
3、分布式并行经验:精通张量并行(TP)、流水线并行(PP)、专家并行(EP)、数据并行(DP)、上下文并行(CP)的原理与实现,熟悉 DeepEP、DeepGEMM 等开源优化技术。
4、KV 缓存技术:深入理解前缀缓存(PrefixCaching)、分页 KV 缓存(PagedKVCache)的原理与实现,具有跨节点缓存、缓存淘汰、压缩与传输的实际工程经验。
5、工程系统能力:熟练使用 Kubernetes 进行容器编排与服务部署,熟悉 GPUOperator、Volcano、Ray 等资源调度工具,具备多租户部署与智能弹性扩缩容能力。
加分项
1、有云厂商 AI 推理平台、头部模型 API 平台或 AI Coding 平台的大规模线上推理系统建设经验。
2、对 vLLM、SGLang、TensorRT-LLM、nvidia-dynamo 等开源项目有重要贡献。
3、具备将投机解码、注意力优化、缓存优化等前沿学术论文快速工程化的能力。
4、有 MoE 模型或万亿级参数模型推理优化经验。
5、熟悉 FPGA、ASIC 等 AI 加速芯片的推理优化技术。