Ivyea Jobs 11257 roles · 203 companies · 刚刚
曦望 · AI 芯片

大模型推理基础设施专家

职位描述

负责大模型推理平台架构设计、性能优化与集群建设,聚焦多模型调度、PD 分离、高并发保障及成本管控;要求具备 vLLM/TensorRT-LLM 等引擎源码经验,精通 CUDA、分布式并行与 KV 缓存,熟悉 K8s 及 GPU 调度,工作直接决定 AI 产品体验与商业化竞争力。

任职要求

必备条件 1、推理引擎能力:对 vLLM、TensorRT-LLM、SGLang、TGI 中至少一个引擎有源码级理解和二次开发经验,能独立修改核心调度器、调优缓存机制与并行策略,熟练使用 nsys、ncu 等工具进行端到端性能剖析。 2、GPU 优化能力:精通 CUDA 编程模型、NCCL 通信原语、NVLink/PCIe 总线特性和 HBM 内存架构,掌握CUDAGraph、Kernel 融合、内存带宽优化等技术,能运用 Roofline 模型定位系统瓶颈。 3、分布式并行经验:精通张量并行(TP)、流水线并行(PP)、专家并行(EP)、数据并行(DP)、上下文并行(CP)的原理与实现,熟悉 DeepEP、DeepGEMM 等开源优化技术。 4、KV 缓存技术:深入理解前缀缓存(PrefixCaching)、分页 KV 缓存(PagedKVCache)的原理与实现,具有跨节点缓存、缓存淘汰、压缩与传输的实际工程经验。 5、工程系统能力:熟练使用 Kubernetes 进行容器编排与服务部署,熟悉 GPUOperator、Volcano、Ray 等资源调度工具,具备多租户部署与智能弹性扩缩容能力。 加分项 1、有云厂商 AI 推理平台、头部模型 API 平台或 AI Coding 平台的大规模线上推理系统建设经验。 2、对 vLLM、SGLang、TensorRT-LLM、nvidia-dynamo 等开源项目有重要贡献。 3、具备将投机解码、注意力优化、缓存优化等前沿学术论文快速工程化的能力。 4、有 MoE 模型或万亿级参数模型推理优化经验。 5、熟悉 FPGA、ASIC 等 AI 加速芯片的推理优化技术。
曦望去官方页面投递 →