职位描述
负责生成式大模型后训练阶段(SFT 微调 → 偏好对齐 → 强化学习)的训练基础设施设计与优化。面对算法快速迭代与大规模探索式采样的双重挑战,构建高效、灵活、可扩展的训练框架,在算法演进与系统效率之间实现最优平衡。
1. 后训练全链路框架设计与演进:主导设计并持续迭代后训练基础设施,完整覆盖 SFT(监督微调)→ RM(奖励模型训练)/ DPO(离线偏好优化)→ PPO / GRPO / DAPO(在线强化学习) 的对齐链路。面向算法快速演进的需求,构建模块化、可插拔的框架架构,实现新算法的高效接入与快速验证。
2. 大规模 Rollout 采样系统优化:针对在线 RL 训练中 Policy 模型频繁生成(Rollout)带来的海量推理请求,设计高效的采样调度系统。优化推理与训练之间的数据流转管道,实现生成、奖励打分、梯度更新三大环节的流水线并行与无缝衔接。
3. 混合资源调度与弹性训练:解决后训练场景下推理(Rollout)与训练(Gradient Update)对 GPU 资源的竞争问题。设计灵活的资源分配与弹性扩缩容策略,根据算法阶段动态调整推理与训练的算力配比,实现集群利用率的全局最优。
4. 训练稳定性与性能调优:保障大规模 RL 训练的稳定性,解决分布式环境下的探索多样性、奖励尺度震荡及训练崩溃等系统性问题。持续优化全链路吞吐,在极致的迭代速度与训练收敛性之间取得平衡。任职要求
1. 算法理解与系统转化能力:深刻理解 SFT、DPO、PPO、GRPO、DAPO 等主流后训练算法的数学原理与计算模式,熟悉 Reward Model 的训练范式及其在 RL 链路中的角色,能够从算法特性出发设计系统架构。理解不同算法阶段对 Infra 的差异化诉求。
2. 框架实战经验:深度使用或精读过 veRL、OpenRLHF、TRL 等开源 RL 训练框架之一的核心源码。有在大规模(百卡/千卡级)集群上落地 RL 训练的实际经验,熟悉其中的分布式采样、经验回放、优势估计等关键模块的实现与瓶颈。
3. 系统架构能力:熟悉推理与训练混合部署的架构模式(如 SGLang/vLLM + 训练框架的混合调度),理解两者之间的显存隔离、通信隔离与任务编排策略。
4. 性能优化方法论:具备从端到端视角进行性能压榨的能力,能够精准定位采样瓶颈、数据传输瓶颈与训练瓶颈,并在迭代速度与训练效果之间进行系统级的权衡决策。
5. 加分项:
- 有视觉/多模态生成模型的后训练(SFT/RM/DPO/RL)落地经验
- 具备优秀的 SFT 阶段调参经验与数据配比/构建经验,深刻理解 SFT 质量对后续 RM 训练及 RL 收敛效果的影响
- 熟悉在线 RL 与离线 RL 的 Infra 差异,并有实际调优经验
- 有自研或深度定制 RL 训练框架的经历