Ivyea Jobs 11396 roles · 207 companies · 刚刚
东方算芯 · AI for Science

*AI推理框架开发工程师

上海 社招 · 全职 社会招聘 推理 / 部署 算法

职位描述

1. 框架开发与适配:基于 SGLang 等主流框架进行大模型推理开发,完成自研 AI 芯片的底层接入、执行流程改造与工程落地。 2. 模型与核心能力支持:适配 LLaMA、Qwen、MoE 等主流大模型,支持 Prefill/Decode、Continuous Batching、KV Cache 等核心推理能力。 3. 全栈联调与优化:协同算子、通信、编译器等底层模块进行端到端联调;定位并解决首 Token 延迟、Decode 吞吐、显存占用及调度开销等性能瓶颈。 4. 前沿技术跟进:跟踪 SGLang、vLLM、TensorRT-LLM 等主流框架动态,推动先进推理能力在自研芯片平台落地。

任职要求

任职资格: 1. 学历与基础:计算机/软件/AI等相关专业本科及以上,硕士优先;精通 Python/C++,具备出色的代码阅读与复杂问题定位能力。 2. 算法与框架:熟悉 PyTorch 及 Transformer 推理原理;熟悉 SGLang、vLLM、TensorRT-LLM 等至少一种推理框架,有源码阅读或适配经验优先。 3. 核心机制理解:深入理解 Continuous Batching、Paged/Prefix/Radix Cache、Speculative Decoding 等推理系统关键机制。 4. 实战与协作:有异构计算平台(GPU/NPU)适配、算子/通信库接入、多卡推理部署经验者优先;具备跨团队协同推动问题闭环的能力。 加分项: a, 深度开发:有 SGLang 源码开发或深度改造经验,或有 vLLM、TensorRT-LLM 等框架开发经验。 b, 模型与算子:熟悉 MoE、MLA、GQA/MQA、稀疏 Attention 等模型结构,或有 CUDA/Triton/自研芯片算子开发经验。 c,分布式与性能调优:有多机多卡推理、PD 分离、分布式 KV Cache 调度经验;有首 Token 延迟、长上下文推理及显存优化实战经验。
东方算芯去官方页面投递 →