职位描述
1、负责多模态/大模型(含视频、音频、图文等方向)在工业化数据生产线与业务落地中的模型推理与部署工作,保障大规模算法服务的高效、稳定运行;
2、负责模型推理性能的优化与加速(如量化、算子优化、推理框架调优等),在保障效果的前提下提升吞吐量、降低延迟与硬件成本;
3、参与高效、稳定的数据处理与自动化标注流水线建设,负责相关 Infra 系统的架构设计、核心代码编写与维护;
4、建立规范的工程交付标准与监控体系,对线上推理服务及数据流水线的稳定性负责,以极强的细心与严谨态度排查解决各类复杂的工程和性能瓶颈。任职要求
1、具备扎实的计算机基础与优秀的工程习惯(如规范的代码风格、完善的日志与错误处理机制),熟练掌握 Python,具备良好的系统设计与架构能力;
2、精通大模型/深度学习推理与部署,熟练掌握主流推理框架(如 vLLM、TensorRT-LLM、Triton Inference Server、ONNX Runtime 等),有实际线上大模型部署与调优经验;
3、做事极具细心与责任心,对线上生产环境心存敬畏,具备出色的性能调优、日志排查及线上故障快速定位能力;
4、极强的工业化落地与目标导向能力,善于将复杂的算法需求转化为稳定、高吞吐的工程交付方案;
5、懂算法原理(如熟悉 LLM、VLM、Diffusion、ASR 等模型架构),能够与算法团队无缝对齐;具备前后端开发经验(如熟悉 FastAPI、Flask、Vue/React 等)或懂分布式数据处理(如 Ray、Spark)者优先。