Ivyea Jobs 14641 roles · 245 companies · 1 小时前
面壁智能 · 大模型

多模态推理infra实习生

职位描述

关于我们 我们是一支专注于端侧多模态大模型推理的团队,致力于让大模型在手机、PC 等设备上实现实时的多模态交互。团队维护自研的开源推理引擎,并持续参与开源社区建设。 职位描述 1、负责推理引擎的核心设计与开发,包括计算图优化、算子与 Kernel 实现、内存与 KV Cache 管理、多流调度; 2、负责实时流式推理链路的设计与优化,覆盖多模态流式编码、多流同步、多模块并行流水线,以及语音链路的 TTS 与声码器,持续优化首包延迟与实时率; 3、负责端侧推理的落地与加速,包括主流 GPU / NPU 后端适配、模型格式转换与量化压缩、内存与显存优化; 4、参与开源项目建设与社区协作,并与训练团队配合打通训练到推理的全链路,跟踪并落地前沿推理优化技术。

任职要求

1、熟悉大模型架构与推理原理,理解计算图、算子、内存布局、KV Cache 等底层细节; 2、熟悉 C++ 和 Python,有扎实的工程基础与良好的代码能力; 3、有主流推理框架 / 引擎的源码级二次开发经验,如 vLLM、SGLang、TensorRT-LLM、llama.cpp 等;端侧推理引擎经验优先; 4、至少熟悉一种 GPU / 加速后端编程:CUDA、Metal、CANN / HIP / SYCL 等。 加分项 1、有全模态 / 多模态大模型推理优化或引擎开发经验; 2、有流式 / 低延迟系统经验(多线程异步流水线、并发与调度、性能剖析),或有语音链路经验(TTS、声码器、流式语音合成、voice cloning); 3、有端侧 / 移动端部署与优化经验(iOS / Android、交叉编译、GPU / NPU 适配),或有大模型推理性能优化经验(量化、内存优化、并行与调度); 4、有知名开源项目的核心贡献或 maintainer 经历。
面壁智能去官方页面投递 →