职位描述职位描述 1. 负责将推理服务工程化迁移,并稳定运行在Kubernetes 集群中,包括服务拆分、资源建模与部署形态设计。 2. 在云厂商提供的裸金属 GPU 节点 上,设计并落地适合实时推理场景的 Kubernetes 部署方案,支持 GPU 独占与有限 sharing 的混合使用模式。 3. 与推理工程师紧密协作,理解完整的推理请求链路,参与推理架构在可部署性、稳定性和可观测性上的优化与重构。 4. 建设并维护推理系统的可观测能力,包括指标、日志、告警与基础链路追踪,支持基于日志的耗时分析与异常定位,并与现有DevOps / Sentry 体系集成。 5. 在 复杂网络拓扑的多集群环境下,排查和定位推理链路中的延迟抖动、网络异常与节点级问题,提升问题定位效率。 6. 使用Ansible 对GPU机器进行管理,包括节点初始化、基础环境配置及日常运维,保障GPU节点的稳定可用。 7. 参与推理系统线上问题的工程级排错与分析,逐步降低 AI 推理系统对核心个人经验的依赖。任职要求1. 3 年以上 SRE / 运维 / 基础设施相关经验,有生产环境系统落地经验。 2. 熟悉Docker与Kubernetes,具备将复杂服务从 Compose 或类似形态迁移到 K8s 的实际经验。 3. 有GPU相关系统 的使用或运维经验,理解GPU在推理场景下的基本使用方式与资源约束。 4. 非常熟悉网络基础与分布式系统网络问题排查,能在复杂拓扑下分析延迟、连接和路由问题。 5. 熟练使用Ansible管理服务器或裸金属节点,具备自动化配置与运维能力。 6. 具备良好的问题分析能力,能沿着推理请求链路进行系统级排错,而不仅停留在单一组件层面。 7. 具备良好的沟通与协作能力,能与推理工程师、DevOps团队高效协作推进问题解决。 加分项 - 有AI推理系统 / 实时服务的生产环境经验。 - 有Kubernetes多集群环境运维经验。 - 使用过Prometheus / Grafana / ELK / Sentry 等可观测工具。 - 熟悉云厂商裸金属或高性能计算相关产品。 - 理解推理系统中的延迟敏感点(如网络、batch、队列等)。