Ivyea Jobs 8169 roles · 112 companies · 刚刚
面壁智能 · 大模型

强化学习自进化实习生

北京 实习 研究 / 科学

职位描述

我们正在探索 AI4AI、自进化智能体与长程 Agentic Learning 等前沿方向。你将参与组内核心强化学习项目,与我们一起训练能够持续探索、自我改进并解决复杂任务的智能体。 工作内容 1. 参与强化学习算法的设计、实现、实验与迭代 2. 搭建和优化 RL 训练基础设施,提高训练效率、稳定性与可扩展性 3. 参与 Agentic Coding、长程 Agent 及自进化系统的训练 4. 分析训练轨迹、奖励信号和数据分布,定位模型能力瓶颈 5. 设计和组织高质量训练数据与评测体系 6. 跟进并复现强化学习、Agent、自进化与具身智能领域的最新工作

任职要求

1. 计算机、人工智能、自动化、数学等相关专业在读 2. 具备扎实的强化学习基础,理解常见算法及其训练机制 3. 算法能力强,能够快速理解论文并将想法落地为实验 4. 工程能力强,熟练使用 Python 和 PyTorch,具备良好的代码质量意识 5. 能独立完成实验设计、训练调试、结果分析与问题定位 6. 对 Agent、自进化、AI4AI 或具身智能方向有浓厚兴趣 7. 学习能力强,愿意面对开放性问题和高不确定性的研究任务 加分项 1. 在强化学习、Agent、AI4AI、自进化或具身智能方向发表过相关论文 2. 有大规模 RL 训练、分布式训练或 RL Infra 建设经验 3. 有 LLM Post-training、RLHF、Agentic RL 或 SWE-bench 相关经验 4. 具备良好的“数据品位”:能够敏锐观察数据、轨迹和训练现象,并据此设计数据配比、采样策略与实验 5. 有优秀的开源项目、竞赛成绩或可展示的研究成果 我们希望你 不一定同时精通算法与基础设施,但至少在其中一个方向有突出能力,并愿意深入真实、复杂的强化学习训练问题。 这里不仅是复现已有方法,你将有机会直接参与前沿方向探索,并对训练方案、数据设计、算法选择和系统实现产生实际影响。
面壁智能去官方页面投递 →