Ivyea Jobs 6505 roles · 88 companies · 刚刚
智元机器人 · 具身智能

云原生与GPU计算平台工程师

上海 社招 · 全职 AI Infra / 训练系统

职位描述

参与智元具身智能云平台的计算基础设施建设,负责容器集群、GPU资源生命周期、通用调度和集群自愈能力。与平台研发、训练平台、存储及网络团队协作,将算力资源转化为可统一管理、稳定交付和持续优化的计算服务。 主要职责 1. 负责Kubernetes集群的建设与生命周期管理,完善节点接入、版本升级和容量扩展能力,持续提升多集群管理效率及资源交付的一致性。 2. 负责集群侧GPU运行时、设备插件及Operator的适配维护,协同集成团队验证驱动基线,建设设备发现、健康检查、资源上报与隔离机制。 3. 围绕资源池、队列、优先级和公平共享设计通用调度能力,根据平台配额及任务需求执行资源分配,优化任务等待时间、利用效率和调度稳定性。 4. 向训练平台提供计算资源及任务运行接口,协同完成分布式任务的资源准备、状态同步和异常处理,明确接口约定并保障跨组件协作可靠。 5. 建设集群故障发现、节点隔离、任务重调度及组件恢复机制,处理设备异常和资源泄漏等问题,完善演练与验证流程,降低故障对业务的影响。 6. 推进GitOps和集群组件发布自动化,编写测试与运维工具,完善容量和性能基准,配合SRE团队沉淀告警、排障手册及变更回滚方案。 承担主要目标/关键任务 1. 负责Kubernetes集群的建设与生命周期管理,完善节点接入、版本升级和容量扩展能力,持续提升多集群管理效率及资源交付的一致性。 2. 负责集群侧GPU运行时、设备插件及Operator的适配维护,协同集成团队验证驱动基线,建设设备发现、健康检查、资源上报与隔离机制。 3. 围绕资源池、队列、优先级和公平共享设计通用调度能力,根据平台配额及任务需求执行资源分配,优化任务等待时间、利用效率和调度稳定性。 4. 向训练平台提供计算资源及任务运行接口,协同完成分布式任务的资源准备、状态同步和异常处理,明确接口约定并保障跨组件协作可靠。 5. 建设集群故障发现、节点隔离、任务重调度及组件恢复机制,处理设备异常和资源泄漏等问题,完善演练与验证流程,降低故障对业务的影响。 6. 推进GitOps和集群组件发布自动化,编写测试与运维工具,完善容量和性能基准,配合SRE团队沉淀告警、排障手册及变更回滚方案。 产出工作结果

任职要求

任职要求 1. 教育背景:本科及以上学历,计算机、软件工程、自动化、电子信息等相关专业优先,重视工程基础和实际项目能力。 2. 工作经验:3年以上云原生平台、容器基础设施或GPU计算平台研发经验,能够独立完成模块设计、开发和交付;5年以上相关经验,具备平台架构或复杂故障治理经历者优先。 3. 熟悉Linux、容器运行时和分布式系统基础,掌握Go或Python等至少一种编程语言,具有可维护服务或基础设施工具的开发经验。 4. 理解Kubernetes资源模型、控制器和调度机制,具备Operator、Controller或调度扩展中至少一类实践,能够分析资源状态不一致及运行异常。 5. 了解GPU驱动、容器运行时及设备资源管理链路,具有GPU资源池或相关计算平台经验,能够结合监控、日志及系统工具定位性能与稳定性问题。 6. 具备接口设计、自动化测试和变更治理意识,能够独立分析复杂工程问题,与训练、网络及存储团队协作,推动方案完成验证、上线和持续改进。 加分项 1. 具有Volcano、Kueue或同类批任务调度系统实践,参与过队列公平性、拓扑感知、弹性分配或资源共享优化,并能说明实际收益。 2. 具有GPU Operator、Network Operator、MIG或异构加速设备接入经验,或参与过云原生开源项目及集群自愈工具建设。
智元机器人去官方页面投递 →