Ivyea Jobs 5948 roles · 69 companies · 1 小时前
智元机器人 · 具身智能

运维架构师

上海 社招 · 全职 AI Infra / 训练系统

职位描述

"1、运维架构整体设计:负责大规模GPU集群、IB/RoCE高速网络、分布式存储、调度资源的运维架构规划与迭代,设计高可用运维架构、故障域隔离、容量架构、扩容演进方案,支撑超大规模AI算力集群的持续规模化扩张。 2、运维体系标准化建设:搭建完整的智算集群运维SOP、变更体系、故障治理体系、值班体系、容灾预案,统一运维规范、基线标准、版本标准、巡检标准,实现运维工作体系化、可复制、可规模化。 3、运营系统架构设计:对接内部云管平台、Infra加速团队,设计算力运营、监控观测、资源管理、SLA履约、资产健康管理整体架构,定义数据口径、指标体系、告警体系、可视化大盘架构。 4、集群可运维性优化:针对GPU异构集群、IB/RoCE网络、多机通信、训练任务场景,优化集群可观测性、故障自愈、故障快速定位能力,降低运维压力,提升集群整体可用率与算力利用率。 5、重大技术风险治理:主导P0/P1级集群事故复盘、架构级根因分析,从架构层面解决集群稳定性、网络风暴、通信异常、调度抖动、硬件批量故障等深层次问题,输出架构优化方案落地。 6、履约与SLA架构设计:结合公司算力设备租赁运营模式,设计资产健康管理、硬件生命周期、故障追责、算力可用率履约体系架构,支撑对内自用、对外商用算力的SLA保障。 7、技术团队赋能:指导SRE、集群运维、测试团队的技术方向,输出架构规范、技术标准、运维最佳实践,统一团队技术口径与执行标准。"

任职要求

"1、本科及以上学历,计算机、通信、云计算相关专业,8年以上大规模数据中心/智算中心运维架构经验,具备超大规模GPU集群架构落地经验。 2、精通GPU异构集群、Linux、IB/RoCE高速网络、分布式存储、Slurm/K8s算力调度架构,熟悉大模型训练集群运维特性与痛点。 3、具备大型智算中心运维体系、SLA体系、可观测体系、故障治理体系从零搭建经验,懂规模化运维架构演进逻辑。 4、熟悉算力运营逻辑,理解算力租赁、资产履约、算力可用率、卡时计量、资源隔离等商业化运营架构需求。 5、具备架构设计、方案输出、跨团队推动落地能力,能协同云管开发、Infra、测试、SRE团队完成体系共建。 6、具备极强的稳定性思维、风险预判能力,能够从架构层面解决集群长期稳定性与运营难题。 7、有头部智算中心、云计算厂商、AI大厂集群架构经验者优先。"