职位描述
1. 负责对齐算法链路的整体搭建和优化,包括离线数据构建、在线反馈机制设计、对齐技术优化、算法效果评估等,持续提升算法的效率与效果
2. 在强化学习、生成对齐等领域开展前沿技术探索和研究,包括但不限于离线强化学习、奖励模型训练等
3. 与工程、产品团队深度合作,建设用户个性化信息生成系统任职要求
1. 在推荐、多模态、LLM和评估等某个领域有较深入的研究,包括但不限于模型预训练(文本、多模态)、文本判别/抽取/生成、自监督学习、自动化对齐等
2. 熟悉 Python 和 PyTorch,具有良好的编程能力和扎实的数学理论基础
3. 具备强化学习算法优化和项目实践经验,熟悉DPO、PPO等强化学习算法,能够基于实际业务问题优化算法;对 RLHF 原理有深入理解,有0-1构建数据集能力者优先
4. 有强烈的工作责任心,良好的团队合作精神,较好的学习能力、沟通能力和自驱力
5. 有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档