Ivyea Jobs 6505 roles · 88 companies · 刚刚
智元机器人 · 具身智能

AI Infra 工程师

上海 社招 · 全职 AI Infra / 训练系统

职位描述

训练方向: 1. 大规模分布式训练系统:在千卡级 GPU 集群上构建稳定、高效的分布式训练系统,支持 VLA 等具身大模型的预训练与微调; 2. 训练效率优化:优化大规模训练中的计算效率、通信效率与 I/O 效率,消除训练瓶颈,提升集群整体利用率; 3. 训练数据加载流水线:构建从存储到 GPU 显存的高吞吐数据流水线,实现高效的数据预取、采样与加载,消除训练过程中的 I/O Stall; 4. 训练稳定性保障:解决大规模训练中的故障恢复、Checkpoint 管理、梯度异常等问题,确保长时间训练任务的稳定运行。 推理方向: 具身模型推理与优化开发 设计面向具身机器人本体亲和的轻量化、高性能推理框架,支持CNN、Transformer、Mamba、GNN等主流网络结构; 面向GPU/NPU的具身多模态算子开发与性能优化,实现内存复用、算子融合、数据排布优化、多流并行等通用加速策略; 开发模型解析、转换、性能剖析、可视化profiling工具; 具身模型性能分析与系统部署 对模型推理过程进行时间、功耗、内存占用分析,定位瓶颈并设计软硬协同优化策略; 实现支持 PTQ/QAT 的量化工具链(INT8/INT4/FP8/MXFP8等浮点混合精度); 探索结构化剪枝、算子重参数化、神经架构搜索与推理引擎的联合优化。 前沿探索 跟进VLA、世界模型、空间智能等最新算法架构趋势,及时洞察捕捉低精度量化、AI KernelGen、投机推理等在具身本体上的模型高效推理适配技术;

任职要求

训练方向: 1. 千卡级训练实战经验:有千卡级 GPU 集群上的大模型训练实战经验,熟悉大规模训练中的常见问题与解决方案; 2. 分布式训练框架:精通 PyTorch 分布式训练机制(DDP/FSDP),熟悉 DeepSpeed、Megatron-LM 等大规模训练框架的原理与使用; 3. 并行策略:深入理解 多维并行(Data Parallel / Tensor Parallel / Pipeline Parallel)的实现原理与适用场景,能够根据模型特点设计最优并行策略; 4. 性能分析与调优:熟练使用 PyTorch Profiler、NVIDIA Nsight 等工具进行性能分析,能够定位并解决计算、通信、I/O 瓶颈。 推理方向: 专业技能 熟练掌握C/C++/Python/Go至少一种编程语言,具备CUDA/OpenCL/CANN优化经验; 深入理解至少一种推理引擎架构(如tensorrt/vllm/sglang/ktransformer/llama-cpp)推理框架架构; 熟悉模型量化原理(KL 散度、MinMax、LSQ、AWQ、GPTQ等)及相关工具链; 熟悉常见典型算子实现与优化(卷积、矩阵乘、激活、LayerNorm、Softmax、flashattention等); 具备AI处理器profiling能力(perf、简单性能计数器、硬件事件、功耗测量)与AI计算负载量化分析能力; 加分项 参与过开源推理引擎贡献(MNN、Tengine、OpenCV、TVM、vLLM、SGLang等); 熟悉MLIR、IREE、Triton、TileLang等编译栈或Dialect开发;
智元机器人去官方页面投递 →