职位描述
岗位定位:本岗位是连接公司AI业务与云端算力的核心枢纽,你将深度参与GPU算力集群的全生命周期管理,并直接服务于公司的算法训练与推理平台。我们寻找的不是传统运维,而是具备开发者视角的“算法基础设施工程师”。
岗位职责
1、负责云端数据管道(Data Pipeline)的日常运维与稳定性保障,涵盖数据同步、存储管理、任务调度等环节,确保算法训练与推理所需数据的高效、稳定供给;
2、负责供应商开发机的环境搭建、账号权限管理、安全策略制定与日常维护,建立开发机全生命周期管理流程;
3、作为技术接口人,对接各AI算力供应商(如阿里云、火山引擎及GPU云服务商)的云端算力需求(含GPU算力卡),完成资源评估、分配调度与算力集群的运维保障;
4、负责公司公有云基础设施的日常运维,涵盖员工权限管理、网络配置、安全组策略、监控告警体系搭建与故障快速响应;
5、编写运维自动化脚本(Python/Shell),持续提升运维效率,沉淀运维文档与操作手册。任职要求
必备要求
1、本科及以上学历,计算机、软件工程、网络工程、信息安全、云计算等相关专业;
2、熟悉至少一种主流公有云平台(阿里云/AWS/火山引擎等),具备云资源部署、监控、成本优化能力;
3、精通Linux操作系统,熟练使用Python/Shell进行自动化运维脚本开发;
4、熟悉Docker容器技术,了解Kubernetes核心概念与基本操作;
5、熟悉Zabbix、Prometheus、Grafana等主流监控工具的使用与配置;
6、具备良好的沟通协调能力,能够作为技术接口人与多方供应商高效协作。
加分项
1、有GPU服务器或AI算力集群(NVIDIA GPU、CUDA、InfiniBand/RoCE网络)运维经验;
2、有Kubernetes集群生产环境运维经验;
3、有数据管道(Airflow/DolphinScheduler、Kafka、ETL等)运维经验;
4、有Terraform、Ansible等IaC自动化工具使用经验;
5、熟悉云成本优化(FinOps)方法与多云架构管理经验。