职位描述
岗位介绍
面向具身智能模型的后训练场景,负责策略推理、环境采样与模型训练之间的系统集成、性能优化和稳定性建设,推动相关任务在摩尔线程 GPU 平台上高效运行。
本岗位优先考察推理引擎、分布式训练及系统性能优化能力。具身智能或强化学习经验为加分项,团队提供相关算法与任务支持。
工作职责
1. 深入开源后训练框架,梳理进程、设备、数据和模型权重的执行与流转链路,完成任务适配和系统集成。
2. 建立端到端性能基线,分析策略推理、环境采样、模型训练、数据传输及权重同步等阶段的耗时与资源利用。
3. 优化批处理、资源分配、并行执行、同步机制及显存使用,减少组件等待,提高整体训练效率。
4. 对接模型推理后端,解决模型执行、权重加载与更新、吞吐及显存相关问题。
5. 通过源码分析、profiling、对照实验和最小复现定位瓶颈,协同算子、通信、驱动及 AI 框架团队完成联调与优化。
6. 与算法和仿真人员合作,验证系统改动对训练正确性、任务效果及稳定性的影响。
7. 沉淀可复用的系统组件、适配代码、性能测试和自动回归能力,支持重点客户交付。任职要求
任职要求
1. 具备扎实的编程和工程能力,熟练使用 Python,能够独立阅读、修改和调试复杂开源项目。
2. 在推理引擎、分布式训练或机器学习系统中,至少一个方向有深入开发经验,参与过核心模块修改、性能优化或复杂故障定位。
3. 理解多进程、异步执行、资源调度、数据传输及同步机制,能够分析跨组件的执行行为和性能问题。
4. 熟悉 GPU 计算基本原理,理解计算、访存、通信和主机调度对性能的影响,能够使用性能分析工具定位瓶颈。
5. 熟悉 PyTorch 或同类深度学习框架,具备模型训练或推理的实际工程经验。
6. 能通过基准测试和对照实验验证优化收益,重视正确性、稳定性和可复现性。
7. 具备独立推进问题闭环及跨团队协作能力,能够有效使用 AI 工具辅助研发,并验证生成代码与分析结论。
加分项
- 有推理引擎的模型接入、批处理、显存管理或权重更新开发经验。
- 有分布式训练、任务调度、计算通信重叠或异构资源管理经验。
- 有强化学习采样系统、机器人仿真或多模态模型相关经验。
- 有国产 GPU 适配、编译器、运行时或 GPU 算子开发经验。
- 有开源项目贡献,或能够展示有实测收益的系统优化案例。