职位描述
1. 负责 Agentic RL 技术在 Soul APP 的落地,面向 AI 陪伴、聊天助手、语音交互等场景,提升模型的多轮任务规划、工具使用、自我纠错和持续交互能力。
2. 设计并优化 Agent 训练流程,包括任务环境构建、交互轨迹采集、奖励设计、强化学习训练和模型评估,推动模型能力从单轮回复向自主完成复杂任务演进。
3. 针对社交场景中的长对话、个性化陪伴和人设一致性问题,研究记忆使用、长期目标保持及多步决策策略,持续改善用户体验。
4. 建立 Agent 能力评估体系,结合离线评测与线上业务反馈,定位任务成功率、交互质量和安全性等方面的问题,并推动优化方案落地。任职要求
1. 全日制硕士及以上学历,2 年及以上大模型算法相关工作经验,具备强化学习或 Agent 项目实践经验。
2. 熟悉大模型后训练技术,理解 SFT、偏好优化及 PPO、GRPO 等强化学习方法,能够独立开展数据构建、奖励设计、训练调优和效果分析。
3. 熟悉 Agent 的规划、工具调用、记忆管理与多轮交互机制,具备任务环境或评测基准的设计经验,能够分析长任务中的错误传播与奖励归因问题。
4. 熟练使用 PyTorch,具备大模型分布式训练经验;能够处理交互轨迹数据、优化训练效率,并将算法效果转化为可衡量的产品体验提升。
5. 对 AI 社交与陪伴场景有兴趣,具备良好的业务理解、实验设计和跨团队协作能力。
加分项
1. 有 Agentic RL、可验证奖励、环境模拟或在线强化学习项目经验。
2. 有 AI 陪伴、对话系统、语音 Agent 或多模态 Agent 落地经验。
3. 有长时记忆、个性化建模或 Agent 安全评估相关经验。