Ivyea Jobs 5948 roles · 69 companies · 1 小时前
智元机器人 · 具身智能

AI算力平台项目经理(AI Infra方向)

上海 社招 · 全职 AI Infra / 训练系统

职位描述

1. 大型 AI 基础设施端到端项目全生命周期管理 负责智算集群扩建、云原生训推平台、灵枢推理引擎、云边协同底座、算力调度门户等核心技术项目统筹;输出 WBS、里程碑、排期、验收标准、风险台账,保障项目按期高质量交付。 承接算法团队、具身机器人业务侧算力需求,将业务诉求拆解为可落地的基础设施技术方案,组织 PoC 验证、方案评审、压测验收。 管理并行多线技术项目,平衡算力采购、平台迭代、线上稳定性、研发成本,识别关键路径、阻塞依赖,推动跨团队闭环解决。 2. 跨职能复杂协同(TPM 核心价值) 内部协同:硬件机房、网络存储、内核驱动、云原生 K8s、CUDA 算子优化、SRE 运维、算法训练、推理、仿真、安全、财务采购多团队对齐;主导周 / 双周技术同步、风险复盘、事后根因分析。 外部协同:NVIDIA / 国产算力厂商、IDC 机房、液冷供应商、网络设备厂商、存储服务商;跟进硬件交付、固件适配、现场上架调试、集群联调全流程。 向上同步:输出管理层周报 / 月报、项目健康度看板、算力容量预测、投入产出分析,汇报重大风险、资源缺口、扩容规划。 3. 智算容量规划、算力成本与 FinOps 管控 基于大模型训练、批量仿真、人形机器人云边推理流量做中长期算力容量预测,输出季度 / 年度 GPU 采购、机房扩容规划。 搭建算力利用率、MFU、任务排队时延、存储占用、公网带宽消耗、集群故障率核心指标体系;推动闲置算力回收、MIG 切分、弹性调度、错峰任务等降本方案落地。 建立算力计量、租户配额、项目成本分摊机制,输出成本分析报告,支撑预算与采购决策。 4. 平台工程化流程、标准与 SOP 沉淀 搭建集群交付、容器镜像发布、模型下发、故障应急、变更管理标准化流程;完善 CI/CD、集群部署、上线变更规范,降低线上故障 MTTR。 沉淀智算集群交付、异构算力纳管、云边协同、推理引擎迭代项目管理模板,形成可复用项目交付方法论。 推动线上稳定性治理:主导重大故障复盘,输出改进项并跟踪闭环,持续提升集群 SLA(训练集群 99.9%、推理服务 99.95%)。 5. 异构 AI 底座专项技术项目推进 统筹 GPU Operator、Kubeflow 训推流水线、FlashInfer/DeepGEMM 算子编译、ccache 编译缓存、灵枢推理引擎、机器人外设统一调度等底层平台专项迭代。 跟进新硬件(Blackwell/Drive Thor、国产 NPU)适配项目,统筹驱动、内核、通信库、框架全栈联调与性能验收。 推进云边协同体系落地:云端智算集群 + 边缘人形机器人统一管控、模型增量下发、多模态采集数据回流全链路项目落地。

任职要求

硬性基础要求 本科及以上计算机 / 电子 / 自动化相关专业,3-5 年技术项目管理 TPM 经验;有AI 智算集群、GPU 训练 / 推理平台、云原生 K8s项目管理完整经验。 具备大型跨团队项目统筹能力,独立主导过百人级、多模块并行的基础设施交付项目,完整走完需求 - 研发 - 测试 - 上线 - 运维闭环。 熟练使用项目管理工具:Jira、Confluence、飞书项目 / 禅道;具备完整风险管控、里程碑、验收交付实战经验。 技术能力核心(AI Infra TPM 区分普通 PM 关键) 精通 AI 智算基础架构:熟悉 GPU 集群、RoCE 高速网络、分布式存储、液冷机房部署流程;了解 HPC、千卡集群交付全流程风险点。 掌握云原生底座核心栈:Docker、K8s、CSI 存储、CNI 网络、RBAC、DaemonSet/StatefulSet、GPU Operator、Volcano 调度器、KServe 推理框架。 懂大模型训推基础流程:PyTorch 分布式训练、模型并行、量化加速、vLLM/Triton 推理、HF 模型下载、算子编译流程;能看懂基础性能指标(MFU、AllReduce 时延、推理 P99 时延)。 具备基础 Linux 运维认知,能看懂集群监控、故障日志,可独立组织压测、性能调优专项评审。 了解具身智能场景加分:Isaac Sim 仿真、ROS2 机器人、云边协同、多模态传感器数据流。 软素质 极强跨部门推动、冲突协调能力,面对多方诉求可做技术与业务平衡取舍; 强风险预判能力,能提前识别算力交付延迟、硬件兼容、线上稳定性、成本超支等风险并制定缓解方案; 数据驱动思维,擅长搭建指标看板、通过量化数据定位瓶颈,输出可落地优化方案; 优秀文档、汇报能力,可独立输出架构方案、项目报告、管理层汇报材料; 抗压,可同步管理多个并行大型基建项目,适应 AI 业务快速迭代节奏。 三、优先加分项 有千卡 / 万卡智算中心建设、IDC 机房交付、NVIDIA 超算集群项目 TPM 经验; 具备 SRE、后端开发、运维、HPC 技术背景转 TPM; 熟悉大模型训练、推理优化、算子库(CUTLASS/FlashInfer)、推理引擎开发流程; 有 FinOps 算力成本治理、云边一体化平台、人形机器人云平台项目经验; 持有 PMP、ACP 项目管理证书。