职位描述
1. 负责智算中心现场运维工作,在数据中心现场完成服务器、GPU 设备、网络设备、存储设备等基础设施的日常维护和操作。
2. 负责设备上架、下架及现场安装工作,包括设备搬运、上架固定、理线、标签粘贴、线缆连接、端口核对、设备加电断电等现场操作。
3. 参与智算资源交付工作,根据交付计划完成服务器安装、网络接入、存储接入、基础连通性检查、交付前检查等工作,保障资源及时交付。
4. 负责服务器及相关硬件的检查和更换,包括硬盘、内存、电源、风扇、网卡、光模块、线缆、GPU 等部件的基础检查、拆装、更换和记录。
5. 负责日常巡检工作,检查机柜、服务器状态灯、设备运行状态、端口连接、线缆规范、机房环境、电力安全、消防通道、现场卫生等,及时发现并反馈异常。
6. 负责故障工单处理,按照工单要求完成现场检查、故障确认、硬件更换、拍照记录、结果反馈等工作,配合主管推动问题闭环。
7. 配合系统层基础运维工作,包括服务器登录、Linux 基础命令操作、网络连通性测试、磁盘状态查看、服务状态检查、日志收集等。
8. 配合 GPU 服务器基础检查,包括 GPU 设备识别、驱动状态确认、基础硬件告警查看、GPU 状态信息收集等工作。
9. 配合带外管理操作,通过 BMC、IPMI、远程控制台等方式完成服务器状态查看、远程开关机、硬件告警查看、故障截图和信息反馈。
10. 配合现场资产管理工作,及时记录和反馈设备 SN、资产编号、机柜位置、U 位、端口连接、硬件更换、维修记录等信息。
11. 配合库房和备件管理工作,按照要求完成备件领取、归还、登记、盘点、报废移交等操作,确保备件流转清晰。
12. 遵守现场操作规范和安全要求,严格执行上架、下架、换件、布线、标签、巡检、工单处理、电力安全、搬运安全等操作流程。
13. 参与现场应急响应和值班工作,按照排班要求完成 58 小时现场在岗及 724 小时应急响应,保障业务稳定运行。
14. 完成主管安排的其他现场运维、交付、巡检、资产和库房相关工作。任职要求
1. 有数据中心、IDC、服务器、网络设备、存储设备或智算中心现场运维经验优先。
2. 熟悉或愿意从事数据中心现场工作,能够适应设备搬运、上架、布线、理线、换件、巡检等现场操作。
3. 了解服务器硬件基础知识,熟悉 CPU、内存、硬盘、网卡、电源、风扇、RAID 卡、GPU 等常见部件者优先。
4. 了解网络布线和设备连接基础知识,能够识别网线、光纤、光模块、MPO/LC 接头、交换机端口等常见设备和线缆。
5. 具备基础 Linux 操作能力,能够使用常用命令完成系统登录、状态查看、日志查看、网络连通性测试、磁盘和服务状态检查等基础操作。
6. 了解服务器带外管理方式,如 BMC、IPMI、远程控制台、远程开关机、硬件告警查看等。
7. 具备基础故障排查意识,能够根据状态灯、告警信息、日志、网络连通性、设备运行状态等进行初步判断,并及时反馈。
8. 具备较强的执行力和责任心,能够按照工单、流程和主管安排完成现场操作,做到操作有记录、结果有反馈。
9. 工作认真细致,具备良好的资产意识,能够准确记录设备 SN、资产编号、机柜位置、U 位、硬件更换和备件流转信息。
10. 具备良好的安全意识,能够遵守数据中心用电安全、搬运安全、设备操作安全、消防安全和机房出入管理要求。
11. 具备良好的团队合作精神和服务意识,能够与主管、同事、客户、厂商、数据中心人员进行基本沟通协作。
12. 身体健康,能适应数据中心现场工作环境,能接受值班、应急响应和阶段性高强度交付工作。
加分项
1. 有智算中心、GPU 服务器、大规模服务器集群现场运维经验。
2. 有 NVIDIA GPU 服务器、HGX、DGX、AI 训练服务器相关维护经验。
3. 有服务器批量上架、批量布线、整机交付、资产盘点经验。
4. 熟悉服务器厂商报修、备件更换、RMA 流程。
5. 使用过工单系统、资产管理系统、库房管理系统、CMDB 或监控系统。
6. 会 Shell、Python 或 Ansible 等基础自动化工具,能够编写简单巡检或信息采集脚本。