Ivyea Jobs 8332 roles · 120 companies · 刚刚
逆矩阵 · AI Infra

高级AI infra工程师(训练系统优化方向)

北京 社招 · 全职 AI Infra / 训练系统

职位描述

1、负责世界模型、DiT、多模态生成模型的大规模训练基础设施建设,持续提升训练吞吐、MFU、显存效率、集群扩展效率、任务稳定性和资源利用率。 2、围绕 FSDP、Megatron、TorchTitan 等分布式训练框架开展工程适配和性能调优,设计并优化并行策略、计算与通信效率以及大规模 GPU 集群下的训练扩展能力。 3、建立数据驱动的训练性能分析与优化体系,定位计算、通信、网络、显存、I/O、Checkpoint、数据加载和任务调度等环节的瓶颈,并完善快速 Checkpoint、故障诊断、容错与恢复等长周期训练可靠性能力。 4、支持世界模型及 DiT 模型的训练与推理优化,推动模型结构、训练与推理框架、算子、通信和硬件拓扑之间的跨层协同优化。 5、与算法、数据、推理、平台和集群团队紧密协作,将前沿研究与性能优化方案转化为稳定、可复用、可规模化的生产级基础设施能力。

任职要求

1、计算机相关专业本科及以上学历,具备扎实的系统编程、分布式系统和性能优化基础。 2、在 AI Infra、分布式训练、机器学习系统、HPC、GPU 计算或大规模后端系统等方向具备丰富的工程经验,具有设计、建设和优化大规模机器学习系统的能力。 3、熟悉 PyTorch 生态,深入理解大模型训练流程,能够基于 Benchmark、Profiling 和运行数据,独立分析训练效率、显存、通信和 I/O 等方面的瓶颈。 4、熟悉 FSDP、Megatron、DeepSpeed、ZeRO 等分布式训练技术,理解 DP、TP、EP、CP/SP 等并行策略及 NCCL 集合通信机制,能够结合模型特点和集群拓扑进行方案选择与优化。 5、熟悉 Python/C++,具备良好的工程实现能力和生产级系统开发能力;有 CUDA、Triton、CUTLASS、TileLang等算子优化经验者优先。 6、能够独立负责 P7 级技术子方向,完成从问题定义、方案设计、工程实现到性能指标和稳定性闭环的完整过程。 7、对 AI Infra 技术有持续热情,理解算法—系统协同设计和跨层优化,愿意深入模型结构与训练机制,推动训练效率、可扩展性和可靠性的系统性提升。 8、具备推理部署优化、模型量化或低精度计算相关经验,理解吞吐、延迟、显存和模型精度之间的权衡。 加分项: 1、有基于大规模 GPU 或其他异构加速卡的训练优化经验,做过 MFU 提升、训练 I/O 优化、显存优化、通信优化或分布式调度优化。 2、熟悉 DiT、视频生成、世界模型、多模态生成模型的训练或推理优化。 3、熟悉 Ray、Slurm、Kubernetes(K8s)等编排框架。 4、熟悉 MoE 训练的主要瓶颈与优化方向,包括 Expert Parallel、负载均衡、通信开销、显存效率和路由优化等。 5、有开源贡献经历,尤其是PyTorch、Megatron、DeepSpeed、vLLM、SGLang 等知名开源项目。有高质量技术博客撰写或公开技术分享经历。 6、有信息学、程序设计或高性能计算竞赛获奖经历,如 IOI、NOI/NOIP、ICPC、ASC 世界大学生超级计算机竞赛、ISC/SC Student Cluster Competition 等。 7、有知名科技公司 Infra 团队工作经历。
逆矩阵去官方页面投递 →