Ivyea Jobs 5948 roles · 69 companies · 1 小时前
银河通用 · 具身智能

具身大模型强化学习工程师

北京 社招 · 全职 算法中心 / 算法类 具身智能 / 机器人

职位描述

职位描述 1. 负责具身智能大模型强化学习(RL)相关算法的研究与开发,探索强化学习在机器人操作、具身决策以及多模态大模型 post-training 中的应用; 2. 设计和优化面向具身智能的强化学习训练框架,包括但不限于 offline RL、online RL、batch online RL、residual RL、human-in-the-loop RL 等方法,提升模型在真实机器人任务中的性能、泛化能力和数据效率; 3. 研究和设计适用于具身大模型的 reward model、critic、task progress / failure signal 等训练与反馈机制,充分利用成功、失败、人工接管等多类型数据,提升策略学习效果并降低 reward hacking 等风险; 4. 探索大模型与强化学习相结合的训练范式,包括 LLM / VLM / VLA 等模型的 RL post-training、策略优化以及 reward-based learning,持续提升模型的推理、决策和机器人操作能力; 5. 面向真实机器人训练场景,研究稳定、安全且高效的 RL 方法,包括 action / force / velocity / workspace constraint、early stop、safety shield 等安全机制,并推动算法在真实机器人系统中的落地; 6. 与机器人系统、运动控制、数据及评测团队紧密合作,持续完善真机 rollout、数据回流、自动 reset、灰度评测及模型迭代闭环,并建立针对真实机器人 RL 的效果、稳定性、安全性和数据效率评测体系; 7. 深入调研强化学习、具身智能和多模态大模型领域的前沿技术,跟踪业界及学术界最新进展,并探索其在具身智能大模型中的应用。

任职要求

1. 人工智能、计算机视觉、自然语言处理、机器人等相关领域硕士及以上学历; 2. 具有扎实的强化学习基础和相关研究/工程经验,熟悉常见强化学习算法、Actor-Critic、Policy Optimization、Offline / Online RL、Reward Modeling 等方向中的一种或多种; 3. 具有以下任一方向的研究或工程经验: - 机器人强化学习、真实机器人 RL、模仿学习或机器人策略学习; - LLM / VLM / 多模态大模型强化学习与 post-training,如 RLHF、RLAIF、基于可验证奖励的 RL、Reward Model / Critic 等; - 大模型 Agent、VLA 或具身智能模型的训练与优化; 4. 对 Transformer、GPT、VLM / 多模态大模型等模型架构及训练方法有深入理解,熟悉大模型 pre-training、post-training 或强化学习训练流程者优先; 5. 精通 Python,具有扎实的深度学习基础,熟悉 PyTorch 等主流深度学习框架,具备良好的算法实现、实验分析和工程落地能力; 6. 具备优秀的学习能力、英文文献阅读能力以及良好的团队沟通与协作能力;有高水平论文发表、开源项目贡献或科技公司相关高阶技术岗位经历者优先。 加分项 具备以下经验之一者优先:真实机器人上的强化学习训练经验;大规模 RL / distributed rollout 训练经验;LLM / VLM RL post-training 经验;Reward Model、Process Reward、Critic / Value Model 相关经验;机器人数据采集、仿真到真机迁移或安全强化学习经验。 立即投递