Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

具身大模型AI Infra工程师/专家

上海 社招 · 全职 具身智能 / 机器人

职位描述

可选择以下一个或多个方向深入参与: 1. 建设具身智能原生的统一训练架构,支撑 VLA、世界模型、多模态生成模型及强化学习模型的预训练与后训练,统一处理异源多模态数据、异构计算图、共享参数和多任务联合训练,面向 1T+ 参数规模演进。 2. 建设大规模分布式训练系统,支持 DP、TP、PP、EP、SP、CP 等多维混合并行,以及 MoE、MoT、长上下文和低精度训练,持续提升百卡、千卡至万卡任务的吞吐、MFU、扩展效率和稳定性。 3. 建设规模化后训练系统,支持在线 / 离线 RL,以及仿真、真机和世界模型混合训练,完善轨迹数据管理、模型权重同步与版本治理,以及机器人动态上下线场景下的弹性调度和故障容错能力。 4. 建设高性能模型推理与自动评测系统,支持 VLA、世界模型等模型的高吞吐、低延迟推理和大规模并发实验,统一管理模型版本、评测任务与结果,支持仿真 / 真机自动评测、版本对比、回归检测和结果追溯。 5. 建设端到端性能与集群基础设施,围绕数据 IO、GPU 计算、集合通信、网络、存储和调度开展 Profiling 与优化,包括算子融合、计算通信 Overlap、Checkpoint、故障恢复和拓扑感知调度。

任职要求

1. 计算机、人工智能、机器人等相关专业本科及以上学历,计算机基础扎实,具备优秀的代码能力和工程习惯,熟练使用 Python 和 PyTorch。 2. 在大规模分布式训练、大模型推理、强化学习 Infra、GPU 集群调度、AI 系统性能优化或模型评测中的一个或多个方向具备深入的实际项目经验。 3. 理解大模型训练与推理原理,熟悉模型并行、计算图、集合通信、显存管理及性能分析,了解 Megatron、DeepSpeed、FSDP、verl、RLinf 等框架中的一种或多种。 4. 理解至少一个具身模型或后训练算法方向,能够从模型结构、数据流和训练 / 推理过程识别 Infra 需求,并跨算法、框架、算子和集群定位问题。 5. 具备良好的系统设计能力,能够通过 Benchmark 和 Profiling 数据推动系统演进,并在正确性、性能、稳定性、扩展性和长期可维护性之间合理取舍。