职位描述
我们正在探索 AI4AI、自进化智能体与长程 Agentic Learning 等前沿方向。你将参与组内核心强化学习项目,与我们一起训练能够持续探索、自我改进并解决复杂任务的智能体。
工作内容
1. 参与强化学习算法的设计、实现、实验与迭代
2. 搭建和优化 RL 训练基础设施,提高训练效率、稳定性与可扩展性
3. 参与 Agentic Coding、长程 Agent 及自进化系统的训练
4. 分析训练轨迹、奖励信号和数据分布,定位模型能力瓶颈
5. 设计和组织高质量训练数据与评测体系
6. 跟进并复现强化学习、Agent、自进化与具身智能领域的最新工作任职要求
1. 计算机、人工智能、自动化、数学等相关专业在读
2. 具备扎实的强化学习基础,理解常见算法及其训练机制
3. 算法能力强,能够快速理解论文并将想法落地为实验
4. 工程能力强,熟练使用 Python 和 PyTorch,具备良好的代码质量意识
5. 能独立完成实验设计、训练调试、结果分析与问题定位
6. 对 Agent、自进化、AI4AI 或具身智能方向有浓厚兴趣
7. 学习能力强,愿意面对开放性问题和高不确定性的研究任务
加分项
1. 在强化学习、Agent、AI4AI、自进化或具身智能方向发表过相关论文
2. 有大规模 RL 训练、分布式训练或 RL Infra 建设经验
3. 有 LLM Post-training、RLHF、Agentic RL 或 SWE-bench 相关经验
4. 具备良好的“数据品位”:能够敏锐观察数据、轨迹和训练现象,并据此设计数据配比、采样策略与实验
5. 有优秀的开源项目、竞赛成绩或可展示的研究成果
我们希望你
不一定同时精通算法与基础设施,但至少在其中一个方向有突出能力,并愿意深入真实、复杂的强化学习训练问题。
这里不仅是复现已有方法,你将有机会直接参与前沿方向探索,并对训练方案、数据设计、算法选择和系统实现产生实际影响。