职位描述
1、负责超算中心机房内服务器、存储、网络设备等硬件设施的日常上下架、布线、标签及出入库管理,确保物理环境整洁规范。
2、负责机房内服务器设备的日常维护、巡检、故障诊断与处理,包括硬件报警响应、部件更换(如电源、风扇、硬盘等)及固件升级。3、负责机房网络设备的配置、监控与故障排查,包括交换机、路由器等,确保网络连通性与稳定性,优化网络拓扑与带宽管理。
4、负责机房服务器存储系统的维护与管理,包括存储设备的配置、扩容、性能监控及故障处理,保障数据存储的高可用性。
5、负责操作系统(Linux)的安装、配置、驱动更新及性能调优,支持超算集群的业务需求。
6、负责GPFS存储系统的配置、维护与优化,包括文件系统挂载、权限管理、容量规划及故障恢复。
7、编写运维文档、应急预案及操作流程,参与机房基础设施的节能管理与风险排查。任职要求
1、本科及以上学历,计算机、网络工程、电子信息等相关专业,3年以上数据中心或超算机房运维经验。
2、熟悉Linux操作系统(如CentOS、Ubuntu)的安装、配置及驱动管理,能独立处理系统级故障。
3、精通交换机网络配置(如华为、H3C、Cisco等品牌),熟悉TCP/IP、VLAN、BGP等网络协议,具备网络故障排查能力。
4、熟悉GPFS存储系统的配置与管理,有实际部署、优化及故障处理经验,了解分布式存储原理。
5、熟悉服务器硬件架构(如x86、ARM),能独立完成服务器上架、硬件检测及故障定位。
6、具备良好的文档撰写能力、团队协作精神及应急响应意识,能适应7×24小时需求响应
加分项:
1、持有HCIE、CCIE等网络认证或GPFS相关技术认证。
2、熟悉Python/Shell脚本,能实现运维自动化。
3、有超算集群(如Slurm和kubernetes调度)或AI算力基础设施运维经验。