职位描述
1. 负责大语言模型(LLM)推理服务的上线部署、版本发布与灰度发布流程建设;
2. 构建并维护高可用、可扩展的LLM推理服务架构,保障7×24小时稳定运行;
3. 监控推理服务的关键指标(如QPS、延迟、GPU利用率、显存、错误率等),推动推理服务的可观测性(Logging/Metrics/Tracing)体系建设;
4. 快速响应并解决线上故障,主导根因分析(RCA),推动系统健壮性持续改进;
5. 探索AIOps在大模型推理运维场景中的应用,如异常检测、智能扩缩容、自愈系统等。任职要求
1. 计算机、电子、通信或相关专业本科及以上学历;
2. 3年以上互联网或AI平台运维/SRE/DevOps相关经验;
3. 有实际的大模型或深度学习服务部署与运维经验,熟悉主流推理框架(如vLLM、SGLang等);
4. 责任心强,具备良好的沟通能力和跨团队协作精神;
5. 有LLM在线服务(如Chatbot、API服务)的高并发运维经验。