职位描述
1. 框架开发与适配:基于 SGLang 等主流框架进行大模型推理开发,完成自研 AI 芯片的底层接入、执行流程改造与工程落地。
2. 模型与核心能力支持:适配 LLaMA、Qwen、MoE 等主流大模型,支持 Prefill/Decode、Continuous Batching、KV Cache 等核心推理能力。
3. 全栈联调与优化:协同算子、通信、编译器等底层模块进行端到端联调;定位并解决首 Token 延迟、Decode 吞吐、显存占用及调度开销等性能瓶颈。
4. 前沿技术跟进:跟踪 SGLang、vLLM、TensorRT-LLM 等主流框架动态,推动先进推理能力在自研芯片平台落地。任职要求
任职资格:
1. 学历与基础:计算机/软件/AI等相关专业本科及以上,硕士优先;精通 Python/C++,具备出色的代码阅读与复杂问题定位能力。
2. 算法与框架:熟悉 PyTorch 及 Transformer 推理原理;熟悉 SGLang、vLLM、TensorRT-LLM 等至少一种推理框架,有源码阅读或适配经验优先。
3. 核心机制理解:深入理解 Continuous Batching、Paged/Prefix/Radix Cache、Speculative Decoding 等推理系统关键机制。
4. 实战与协作:有异构计算平台(GPU/NPU)适配、算子/通信库接入、多卡推理部署经验者优先;具备跨团队协同推动问题闭环的能力。
加分项:
a, 深度开发:有 SGLang 源码开发或深度改造经验,或有 vLLM、TensorRT-LLM 等框架开发经验。
b, 模型与算子:熟悉 MoE、MLA、GQA/MQA、稀疏 Attention 等模型结构,或有 CUDA/Triton/自研芯片算子开发经验。
c,分布式与性能调优:有多机多卡推理、PD 分离、分布式 KV Cache 调度经验;有首 Token 延迟、长上下文推理及显存优化实战经验。