Ivyea Jobs 5948 roles · 69 companies · 1 小时前
生数科技 · AI 应用

大模型Infra工程师 (VLM推理)

北京 社招 · 全职 多模态 / 视觉 / 语音

职位描述

负责 VLM(视觉-语言模型)大规模推理服务的基础设施设计与优化。以极致吞吐与极致成本为核心目标,从服务架构到底层 Kernel 进行全栈压榨,在既定算力预算下支撑尽可能大的业务流量。 1. 推理服务架构设计与优化:主导 VLM 在线推理服务的架构设计与持续演进,深度定制 SGLang 推理框架,针对 VLM 特点(长视觉序列、Prefill/Decode 异构计算)进行系统级适配与优化。持续提升服务吞吐上限,降低单 Token 推理成本。 2. 显存管理与 KV Cache 极致压榨:针对 VLM 多图/长视频场景下 KV Cache 巨大的问题,设计高效的显存管理方案。深入理解并优化 SGLang 的 RadixAttention(前缀缓存)机制,结合 PagedAttention 等分页管理策略,最大化 Batch Size 与缓存命中率,提升单卡吞吐容量。 3. 推理成本极致优化:围绕单卡吞吐量与推理成本两大核心指标,落地并优化量化方案(FP8/INT4/AWQ/GPTQ)、投机采样(Speculative Decoding)等降本增效手段。在保证生成质量的前提下,持续提升每 GPU 的服务吞吐,降低单位 Token 的算力成本。 4. 全链路性能 Profiling 与调优:建立系统级性能看护体系,从请求接入、多模态数据预处理、Prefill 计算到 Decode 自回归生成,进行全链路吞吐拆解与瓶颈定位。优化 CPU 预处理与 GPU 推理之间的数据管道,最大化 GPU 有效计算占比。

任职要求

1. 推理框架深度掌握:精读过 SGLang 核心源码,对其调度器(Scheduler)、RadixAttention 缓存机制、CUDA Graph 加速、Overlap 调度等核心模块有系统性理解与实战优化经验。熟悉 vLLM 并有对比认知者更佳。 2. VLM 推理认知:深刻理解 VLM 推理与纯文本 LLM 推理的差异(长视觉序列带来的 Prefill 压力、多图并行处理、视频抽帧与特征压缩等),并有针对性的架构优化经验。 3. 降本增效工具箱:熟悉主流量化推理方案(FP8/INT4/AWQ/GPTQ)的原理与落地代价,有投机采样(Speculative Decoding)的实战经验,能够在质量与吞吐之间做出精准的工程权衡。 4. 系统级性能调优能力:具备端到端的吞吐拆解能力,能够精准定位 CPU 预处理、数据传输、GPU 计算等各环节的吞吐瓶颈,并有系统化的方法论驱动持续优化。 5. 加分项: - 有 VLM(含视频输入)大规模推理服务落地经验,并有显著的吞吐/成本优化成果 - 熟悉多模态输入的预处理/后处理优化(如图像 Resize/归一化与 GPU 之间的零拷贝流水线) - 有 Triton Inference Server / TensorRT-LLM 等其他推理框架的深度使用经验