职位描述
负责维护和管理高性能计算(HPC)集群系统,确保系统稳定运行,优化系统性能,解决系统故障,为用户提供高效的技术支持和服务。
(1)系统日常运维.负责高性能计算集群的日常监控、维护和管理工作,确保系统稳定运行。及时发现并处理潜在问题。
(2)故障排查与解决.快速响应并排查高性能计算集群的硬件、软件及网络故障。分析系统性能瓶颈,提出并实施优化方案。协调供应商和合作伙伴,解决复杂的技术问题。
(3)系统优化与升级。根据业务需求,对高性能计算集群进行性能调优和配置优化。规划并执行系统升级计划,确保升级过程中的稳定性和连续性。
(4)用户支持与服务。为用户提供高性能计算集群的使用培训和指导。收集用户反馈,不断改进和优化系统服务。建立用户沟通机制,及时解决用户在使用过程中遇到的问题。
(5)文档编写与更新。编写和维护高性能计算集群的运维手册、操作指南和技术文档。记录故障处理过程和优化方案,形成知识库供团队共享。
(6)负责公司产品的交付。掌握公司自有产品的部署,安装,配置。可以保障稳定运行
(7)安全管理。负责高性能计算集群的安全防护工作,包括系统安全配置、漏洞扫描和修复等。遵守公司的信息安全政策和流程,保护用户数据的安全和隐私。任职要求
(1)2年以上HPC运维经验,有制造行业运维经验者优先
(2)对硬件了解,掌握服务器,IB网络,以太网络基础硬件知识,掌握硬件性能故障诊断测试工具方法,有过相关硬件实施经验者优先
(3)掌握操作系统,PBS调度系统,并行文件系统(GPFS,lustre其中一种或者两种),用户认证系统(NIS,LDAP其中一种或者两种)的部署,配置,运维。
(4)掌握应用(starccm,abaqus,nastran等制造业常用软件)的部署安装,作业提交脚本的编写调试,以及故障排错。
(5)掌握系统运维常规技能。系统巡检工具,集群监控系统部署,日志分析,运维自动化脚本编写
(6)运维工作标准化。接触过运维标准化流程,能够完成运维相关文档,和项目相关文档的编写
(7)具备良好的客户服务意识,对客户服务,如何让客户满意有相关经验,并承受工作压力。有客户现场服务经验者优先