Ivyea Jobs 6451 roles · 88 companies · 刚刚
云知声 · AI 应用

超算机房运维工程师岗

北京 社招 · 全职 AI Infra / 训练系统

职位描述

1、负责超算中心机房内服务器、存储、网络设备等硬件设施的日常上下架、布线、标签及出入库管理,确保物理环境整洁规范。 2、负责机房内服务器设备的日常维护、巡检、故障诊断与处理,包括硬件报警响应、部件更换(如电源、风扇、硬盘等)及固件升级。3、负责机房网络设备的配置、监控与故障排查,包括交换机、路由器等,确保网络连通性与稳定性,优化网络拓扑与带宽管理。 4、负责机房服务器存储系统的维护与管理,包括存储设备的配置、扩容、性能监控及故障处理,保障数据存储的高可用性。 5、负责操作系统(Linux)的安装、配置、驱动更新及性能调优,支持超算集群的业务需求。 6、负责GPFS存储系统的配置、维护与优化,包括文件系统挂载、权限管理、容量规划及故障恢复。 7、编写运维文档、应急预案及操作流程,参与机房基础设施的节能管理与风险排查。

任职要求

1、本科及以上学历,计算机、网络工程、电子信息等相关专业,3年以上数据中心或超算机房运维经验。 2、熟悉Linux操作系统(如CentOS、Ubuntu)的安装、配置及驱动管理,能独立处理系统级故障。 3、精通交换机网络配置(如华为、H3C、Cisco等品牌),熟悉TCP/IP、VLAN、BGP等网络协议,具备网络故障排查能力。 4、熟悉GPFS存储系统的配置与管理,有实际部署、优化及故障处理经验,了解分布式存储原理。 5、熟悉服务器硬件架构(如x86、ARM),能独立完成服务器上架、硬件检测及故障定位。 6、具备良好的文档撰写能力、团队协作精神及应急响应意识,能适应7×24小时需求响应 加分项: 1、持有HCIE、CCIE等网络认证或GPFS相关技术认证。 2、熟悉Python/Shell脚本,能实现运维自动化。 3、有超算集群(如Slurm和kubernetes调度)或AI算力基础设施运维经验。