职位描述
1.负责公司生产环节的稳定性建设,设计、构建和维护高可用、可扩展的系统架构,快速响应和解决生产环境中的问题。
2.开发和维护系统监控工具,设置有效的报警机制,确保及时发现和解决问题。
3.与开发和产品团队紧密合作,编写和维护自动化脚本和工具,以提高运维效率。
4.撰写和维护技术文档,参与制定和优化运维流程和标准。任职要求
1.计算机或相关专业的本科及以上学历。
2.3年以上相关工作经验,具备在大规模分布式系统中工作的经历。
3.熟练使用至少一种编程语言(如Python、Go、Java等)。
4.熟悉云服务(如AWS、阿里云、腾讯云)。
5.熟悉容器技术(如Docker、Kubernetes)。
6.熟悉配置管理工具(如Ansible、Chef、Puppet)和基础设施即代码(IaC)工具(如Terraform)。
7.熟悉监控和日志系统(如Prometheus、Grafana、ELK Stack)。
8.具备自我驱动力,能够主动学习和适应新技术、新工具。