Ivyea Jobs 11405 roles · 206 companies · 刚刚
东方算芯 · AI for Science

*AI训练框架开发工程师

上海 社招 · 全职 社会招聘 训练系统 / 集群 算法

职位描述

1.训练框架开发与改造:大模型训练框架的功能改造与工程落地,如基于 Megatron-LM / Megatron-Core 等进行。 2. 底层组件接入:负责自研算子库与通信库的接入、接口适配及精度对齐,支持 TP/PP/DP/CP 等并行策略在自研芯片上稳定运行。 3. 模型适配与优化:负责 LLaMA、GPT、MoE 等大模型在自研芯片上的跑通、精度验证、性能优化与稳定性提升。 4. 全栈协同与攻坚:参与算子、通信、编译器等底层软件栈的联调;定位并解决 Loss 异常、通信 Hang、显存异常等复杂训练问题。 5. 前沿技术跟进:跟踪 Megatron、PyTorch、DeepSpeed 等主流框架动态,推动先进训练能力在自研平台落地。

任职要求

任职资格: 1. 学历与基础:计算机/软件/AI等相关专业硕士及以上;精通 Python/C++,具备出色的代码阅读与问题定位能力。 2. 算法与框架:熟悉 PyTorch 训练流程及 Transformer 原理;熟悉 Megatron-LM、DeepSpeed 等主流训练框架,深入理解 TP/PP/DP/CP 等分布式训练机制。 3. 实战经验:有 AI 芯片/GPU/NPU 训练框架适配、算子/通信库接入、多机多卡调试及性能优化经验者优先。 4. 协作能力:具备较强的跨团队协作能力,能与底层软件、算法团队高效配合推动问题闭环。 加分项: a, 深度开发:有 Megatron-LM / Megatron-Core 源码开发或深度改造经验。 b, 大规模实战:有千卡级大规模多机多卡训练经验。 c, 底层技术:熟悉 NCCL/HCCL 等通信库,或有 CUDA/Triton/自研芯片算子开发经验。 d, 模型与排障:有 LLaMA、GPT、MoE 等模型适配经验,且有解决 Loss 异常、NaN、通信 Hang 等复杂问题的实战经验。
东方算芯去官方页面投递 →