Ivyea Jobs 10091 roles · 156 companies · 刚刚
并行科技 · AI Infra

云平台与分布式存储运维工程师

北京 校招 · 全职 研发 AI Infra / 训练系统

职位描述

1)参与 Kubernetes 容器云平台的规划、部署、升级与日常运维,包括网络(CNI)、存储(CSI)、CI/CD、镜像仓库等周边组件的建设与维护; 2)参与 Ceph、JuiceFS、GPFS(IBM Storage Scale)等分布式存储系统的规划、部署、扩容与日常运维; 3) 负责 K8S 平台与分布式存储的对接与集成,为容器业务、大数据与 AI 训练平台提供稳定的存储服务; 4) 建设与优化监控、告警、日志体系,负责日常巡检、性能调优与容量管理,处理故障并输出复盘报告; 5) 编写自动化运维脚本与工具(Shell / Python / Go),提升平台与存储的运维效率; 6)跟踪社区版本与新技术,编写与维护运维文档、标准操作流程(SOP)及技术调研报告。

任职要求

(一)基本要求(硬性条件) 1)有实际的 Linux 使用经验:熟悉常用命令与基本系统管理操作(文件与权限、进程、网络、日志查看、软件安装等),在课程、实验、竞赛或个人项目中真实使用过 Linux; 2)具备扎实的计算机基础:了解操作系统、计算机网络(TCP/IP)、数据结构的基本概念; 3)至少掌握一门脚本或编程语言(Shell、Python、Go、C/C++、Java 均可),能读懂并编写简单程序; 4)具备良好的英文技术文档阅读能力(官方文档多为英文)。 (二)核心素质(重点考察) 1)学习能力强:能通过阅读官方文档、源码和社区资料快速掌握陌生技术,并动手实践验证,这是本岗位最看重的素质; 2) 动手能力与排障思维:遇到问题能自主查日志、查资料、做实验定位原因,而不是止步于"报错了"; 3)责任心与稳定性意识:理解生产环境操作的严肃性,做事有checklist意识,敬畏变更; 4) 沟通与文档能力:能把技术问题讲清楚、写明白; 5) 能接受 7x24 小时轮值 on-call(有调休/补偿,以公司制度为准)。 (三)加分项(非必需) 1) 使用过 Docker/Podman 等容器技术,了解或搭建过 Kubernetes(包括 minikube/kind 等学习环境); 2) 了解或实践过任一分布式存储/文件系统:Ceph、JuiceFS、GPFS、HDFS、GlusterFS、MinIO 等; 3)了解监控体系(Prometheus/Grafana)、配置管理(Ansible)或 IaC 工具; 4)有个人技术博客、GitHub 开源项目; 5) 持有 RHCE/RHCSA、CKA 等相关认证; 6) 有云计算、运维、存储相关实习经历。
并行科技去官方页面投递 →