Ivyea Jobs 6461 roles · 88 companies · 刚刚
千寻智能 · 具身智能

大模型云端推理架构与部署工程师

北京 / 杭州 社招 · 全职 交付 / 解决方案(FDE)

职位描述

1、负责多模态大模型(VLM)在云端的高性能分布式推理系统设计、开发与全链路端到端部署。 2、负责将前沿的推理加速机制(如PD分离、全局KV池化、长文本上下文处理等)快速工程化,构建高可用、高吞吐的推理服务。 3、跟进解决大规模服务调用中遇到的性能瓶颈与长尾问题,持续优化集群吞吐量(Throughput)、首字延迟(TTFT)与推理显存占用。

任职要求

1、计算机、软件工程、人工智能等相关专业;具备分布式系统架构、后端开发或AI基建(AI Infra)相关工作经验。 2、精通 Python/C++,熟悉 PyTorch 等深度学习框架;深入理解大模型底层网络结构(如 Transformer、MoE),并熟练掌握至少一种主流开源推理引擎(如 vLLM、SGLang、TensorRT-LLM、Nvidia Dynamo等)的底层机制与源码魔改。 3、熟悉主流的大模型分布式推理与云原生工程化技术,包括但不限于模型/流水线并行(TP/PP)、Continuous Batching、PagedAttention、K8s/Docker容器编排、API网关及系统可观测性建设。 4、持续跟踪大模型推理与系统优化领域的前沿进展,能够快速评估并引入适配公司业务(如极速对话、高吞吐批处理、多模态并发)的技术方案。 加分项: 1、具备异构算力(Nvidia GPU/国产算力)底层调度调优经验,熟练掌握 CUDA/Triton 算子编程及性能剖析(Profiling)者优先。
千寻智能去官方页面投递 →