职位描述
1.训练框架开发与改造:大模型训练框架的功能改造与工程落地,如基于 Megatron-LM / Megatron-Core 等进行。
2. 底层组件接入:负责自研算子库与通信库的接入、接口适配及精度对齐,支持 TP/PP/DP/CP 等并行策略在自研芯片上稳定运行。
3. 模型适配与优化:负责 LLaMA、GPT、MoE 等大模型在自研芯片上的跑通、精度验证、性能优化与稳定性提升。
4. 全栈协同与攻坚:参与算子、通信、编译器等底层软件栈的联调;定位并解决 Loss 异常、通信 Hang、显存异常等复杂训练问题。
5. 前沿技术跟进:跟踪 Megatron、PyTorch、DeepSpeed 等主流框架动态,推动先进训练能力在自研平台落地。任职要求
任职资格:
1. 学历与基础:计算机/软件/AI等相关专业硕士及以上;精通 Python/C++,具备出色的代码阅读与问题定位能力。
2. 算法与框架:熟悉 PyTorch 训练流程及 Transformer 原理;熟悉 Megatron-LM、DeepSpeed 等主流训练框架,深入理解 TP/PP/DP/CP 等分布式训练机制。
3. 实战经验:有 AI 芯片/GPU/NPU 训练框架适配、算子/通信库接入、多机多卡调试及性能优化经验者优先。
4. 协作能力:具备较强的跨团队协作能力,能与底层软件、算法团队高效配合推动问题闭环。
加分项:
a, 深度开发:有 Megatron-LM / Megatron-Core 源码开发或深度改造经验。
b, 大规模实战:有千卡级大规模多机多卡训练经验。
c, 底层技术:熟悉 NCCL/HCCL 等通信库,或有 CUDA/Triton/自研芯片算子开发经验。
d, 模型与排障:有 LLaMA、GPT、MoE 等模型适配经验,且有解决 Loss 异常、NaN、通信 Hang 等复杂问题的实战经验。