Ivyea Jobs 11247 roles · 203 companies · 刚刚
曦诺未来 · 具身智能

云端运维工程师

杭州 社招 · 全职 机械结构类 训练系统 / 集群 工程开发

职位描述

岗位定位:本岗位是连接公司AI业务与云端算力的核心枢纽,你将深度参与GPU算力集群的全生命周期管理,并直接服务于公司的算法训练与推理平台。我们寻找的不是传统运维,而是具备开发者视角的“算法基础设施工程师”。 岗位职责 1、负责云端数据管道(Data Pipeline)的日常运维与稳定性保障,涵盖数据同步、存储管理、任务调度等环节,确保算法训练与推理所需数据的高效、稳定供给; 2、负责供应商开发机的环境搭建、账号权限管理、安全策略制定与日常维护,建立开发机全生命周期管理流程; 3、作为技术接口人,对接各AI算力供应商(如阿里云、火山引擎及GPU云服务商)的云端算力需求(含GPU算力卡),完成资源评估、分配调度与算力集群的运维保障; 4、负责公司公有云基础设施的日常运维,涵盖员工权限管理、网络配置、安全组策略、监控告警体系搭建与故障快速响应; 5、编写运维自动化脚本(Python/Shell),持续提升运维效率,沉淀运维文档与操作手册。

任职要求

必备要求 1、本科及以上学历,计算机、软件工程、网络工程、信息安全、云计算等相关专业; 2、熟悉至少一种主流公有云平台(阿里云/AWS/火山引擎等),具备云资源部署、监控、成本优化能力; 3、精通Linux操作系统,熟练使用Python/Shell进行自动化运维脚本开发; 4、熟悉Docker容器技术,了解Kubernetes核心概念与基本操作; 5、熟悉Zabbix、Prometheus、Grafana等主流监控工具的使用与配置; 6、具备良好的沟通协调能力,能够作为技术接口人与多方供应商高效协作。 加分项 1、有GPU服务器或AI算力集群(NVIDIA GPU、CUDA、InfiniBand/RoCE网络)运维经验; 2、有Kubernetes集群生产环境运维经验; 3、有数据管道(Airflow/DolphinScheduler、Kafka、ETL等)运维经验; 4、有Terraform、Ansible等IaC自动化工具使用经验; 5、熟悉云成本优化(FinOps)方法与多云架构管理经验。
曦诺未来去官方页面投递 →