职位描述
岗位要求:
1、本科及以上计算机相关专业, 备8年以上系统运维、SRE、DevOps或平台工程相关经验,具有3年以上团队管理或技术团队负责人经验。
2、熟悉Centos、Ubuntu Red Hat等Linux 操作系统,深刻了解系统资源调度、网络配置及异常监控、防火墙技术,熟悉基本的安全常识;
3、熟悉docker和Kubernetes容器管理技术;
4、熟悉主流数据库的部署、及日常运维操作;
5、熟悉Python/Shell至少一门语言,能独立开发自动化运维工具;
6、具有良好的产品学习能力和文档输出意识;具有较强的沟通能力,独立分析解决问题的能力,良好的团队协作精神,和强烈的责任感;
7、对AI辅助运维有实际理解、AI coding agent的深度使用者
加分项:
1. 有SaaS平台、私有化部署或多区域客户运维经验。
2. 有BI、CDH、CDP等大数据平台的运维经验或Spark、flink等计算引擎的实际运维经验
3. 有服务央国企、金融类大客户的相关经验
3. 有有5人以上技术团队管理、招聘和绩效管理经验,尤其异地团队管理的相关经验
4. 有平台工程、自助式运维平台或内部开发者平台建设经验
岗位职责:
1、负责公司SaaS和私有计算平台的运维工作,保证生产环境各项目的稳定运行,及时响应并解决各类故障;对于部分本地大区内的大客户或银行金融类客户,可以协调团队资源按需上门支持;远程支持本大区客户运维相关工作。
2、开发运维工具,负责运维和公司产品的升级自动化,提升运维效率和服务质量;制定并推动公司AIOps及AI辅助运维建设路线
3、建设运维知识库,将产品文档、部署手册、故障案例、复盘报告和标准操作手册形成可检索、可维护的知识体系
4、设计受控的AI自动化执行机制、建立AI运维效果评估机制,关注准确率、误报率、告警压缩率、人工节省时间和故障恢复效率、确保AI工具使用符合公司数据安全要求