职位描述可靠性工程体系构建:定义并量化SLO/SLI,建立错误预算管理机制;设计容量规划与预测模型,确保系统支撑业务增长;建立P0/P1/P2故障分级响应机制与标准化应急处理流程。 多云算力平台运维:负责多云算力平台架构设计与日常运维,保障AI训练与推理服务高可用(SLA ≥ 99.9%);优化GPU集群资源调度策略,实现异构算力弹性伸缩与高效利用;建立算力成本分摊与预算告警机制,追踪大模型调用费用并优化资源配置。 数据链路平台建设:负责数据链路平台架构设计与技术支持,构建从数据采集、处理、存储到服务发布的端到端数据管道;保障数据质量与一致性,降低处理延迟,支持PB级数据实时与离线处理。 全链路可观测性体系:构建覆盖Metrics、Logs、Traces三大维度的可观测性平台;设计智能告警策略,实现告警聚合、降噪与根因分析,降低误报率;建立监控仪表盘与健康度评分体系,提供系统状态全景视图。 自动化与效率提升:开发自动化运维工具链,实现IaC与CaC落地;构建自助服务平台,为研发团队提供标准化运维操作界面;实施Toil减少计划,识别并自动化重复性运维任务,持续提升效率。 故障管理与应急响应:建立标准化故障处理流程(发现→响应→修复→复盘),参与7×24小时on-call值班;定期组织故障演练与混沌工程实验,验证系统韧性;编写无指责故障复盘报告,推动根本原因解决与系统性改进。 容量规划与成本优化:建立基于业务增长趋势的容量预测模型,提前规划资源需求;实施云资源成本优化策略,包括Spot实例调度、资源预留优化、弹性伸缩配置等;持续监控分析系统资源利用率,推动GPU、CPU、存储等资源利用效率提升。 研发协作与赋能:为研发团队提供可靠性工程咨询,推动可测试性、可运维性、可观测性设计原则落地;组织SRE最佳实践分享与培训,提升团队整体可靠性意识;协助业务团队制定合理的SLO目标,提供系统稳定性保障的专业支持。任职要求1.本科及以上学历,计算机科学、软件工程、人工智能等相关专业 2.系统与网络基础:精通Linux系统管理与性能调优,熟悉TCP/IP网络协议栈,具备扎实的系统排障能力。 3.云原生技术栈:熟练掌握容器化技术(Docker)与编排工具(Kubernetes),具备K8s集群及常用公有云产品运维经验。 4.开发能力:具备Python/Go/Shell开发能力,能够独立编写自动化运维脚本与工具,推动基础设施即代码(IaC)实践。 5.具备优秀的故障排查与问题解决能力,能够在压力下快速速响应生产事件;具备良好的沟通协调能力与团队协作精神;具备强烈的责任心与工程思维,注重文档规范与知识沉淀。 加分项: 1.3年以上AI基础设施运维经验,或有大规模分布式系统或SRE相关经验者优先。 2.AI基础设施:了解AI计算框架(PyTorch/TensorFlow)的底层依赖与部署优化;熟悉GPU硬件(NVIDIA)及高速网络协议(InfiniBand/RoCE);掌握大模型训练与推理框架(vLLM、TensorRT-LLM、DeepSpeed等)者优先。 3.监控与可观测性:熟悉主流监控告警系统(Prometheus/Grafana/Alertmanager)的部署与配置,具备全链路监控设计能力。 4.云原生项目经验:熟悉或运维过 volcano、argo、Istio、knative、ray 等项目者优先。