职位描述我们正在寻找一位资深的高级 SRE / DevOps 工程师,负责构建和守护支撑千万级并发请求的 AI 实时流媒体与算力基础设施。该岗位将主导万卡级 GPU 集群的稳定性建设,保障千亿参数大模型及复杂多模态系统在生产环境中的高可用运行。你将通过建设高度自动化的发布体系、全链路的可观测性平台以及标准化的平台工程(Platform Engineering),大幅降低系统风险,并为研发团队提供极致的工程生产力。 核心职责: 1、基础设施与 GPU 集群稳定性建设: 负责高密度 GPU 节点的自动化供给、监控告警与故障自愈。设计高可用的灾备架构,保障底层算力池满足严苛的 SLA/SLO 标准。 2、高可用架构与容量规划: 针对超大参数量 LLM及视觉生成模型的私有化部署,设计并实施智能流量调度、负载均衡、熔断降级与自动化扩缩容(HPA/VPA)策略,从容应对突发性高并发流量。 3、实时流媒体链路保障: 守护全双工实时音视频流媒体服务的生产环境。优化底层网络架构,解决跨地域、跨公有云/私有云的传输延迟、网络抖动及高并发连接稳定性问题。 4、开发者平台工程与发布体系: 维护企业级 API 网关(兼容主流大模型协议),保障鉴权、限流、计费及 Webhook 回调系统在高吞吐量下的绝对稳定。打造流畅的 CI/CD 流水线与 GitOps 体系,实现复杂后端服务及 AI Agent 框架的无缝灰度发布与回滚。 5、全链路可观测性与应急响应: 建设覆盖“硬件指标-网络 I/O-业务黄金指标(如首帧延迟、API 成功率)”的全方位监控系统。主导生产环境的故障应急响应(Incident Response),组织复盘(Post-mortem)并落地改进措施。任职要求1、计算机科学、软件工程或相关专业本科及以上学历,具备 5 年以上大规模生产环境下的 SRE、DevOps 或平台工程经验。 2、深入理解 Linux 操作系统内核机制、系统资源管理(Cgroups/Namespaces)与复杂网络协议栈(TCP/IP, HTTP/2, WebSocket, WebRTC)。 3、极度精通 Kubernetes 容器编排生态,拥有在大规模集群中管理复杂有状态服务、GPU 资源调度(Device Plugin)及定制 Operator 的实战经验。 4、熟练掌握 Go、Python 或 Rust 中的至少一种语言,具备优秀的工具链开发能力,能够通过代码消除重复性运维工作(Toil)。 5、熟练掌握基础设施即代码(IaC)工具(如 Terraform, Ansible)及云原生监控栈(Prometheus, Grafana, ELK/EFK, OpenTelemetry)。 6、具备极强的系统化思维和故障排查能力(Troubleshooting),能够在高压下快速隔离并恢复生产级 P0 故障。 加分项: 1、具备千亿参数级开源 LLM及复杂 AI Agent 框架的大规模生产环境部署、运维与保障经验。 2、对音频流、视频流底层协议及相关中间件有运维经验,熟悉高安全性网关、即时通讯消息队列或复杂网络端口/服务转发的配置。 有构建或深度维护面向外部开发者的公有 API 平台或 PaaS 平台的履历,深谙多租户隔离与资源配额管理。 具备较强的技术影响力,能够在团队内部推动 SRE 文化,制定并落实工程规范。