Ivyea Jobs 5948 roles · 69 companies · 刚刚
优必选 · 具身智能

具身强化算法研究员(优核U-Core计划)

深圳 校招 · 全职 优核U-Core计划 具身智能 / 机器人

职位描述

模块方向:具身大模型方向 课题方向:人形机器人交互式强化学习 方向内容:样本效率与真实物理的矛盾。通过人类反馈等高效监督,解决传统真机RL时间和经济成本太高的问题。 奖励函数的 "对齐难题"。开放式任务面临reward hacking问题、稀疏奖励问题。 安全探索的硬约束。探索过程中面临损坏等风险。 岗位职责 高效交互式 RL 算法研究。基于大模型先验的样本提效探索,离线 RL + 在线微调的混合范式,高效冷启动。 人类反馈对齐与交互式奖励建模。设计支持多模态人类反馈的奖励学习框架,研究大语言模型作为 "奖励评论家"(Reward Critic)的方案。 安全强化学习与约束探索。设计人形机器人安全探索框架,研究不确定性估计与风险敏感策略。

任职要求

专业要求: 计算机、自动化、机器人、数学等相关专业硕士及以上学历 深入掌握强化学习理论,精通 PPO、SAC、离线 RL、偏好学习等核心算法 有 RL 算法从 0 到 1 的实现经验,不只是调库,而是能推导公式、改写底层 加分项: 有人形机器人 / 机械臂 RL 真实部署经验,踩过 sim-to-real 的坑 有人类反馈强化学习(RLHF)、偏好学习、逆强化学习相关研究 熟悉最优控制、轨迹优化、MPC 等经典机器人控制方法 有安全 RL、约束优化、鲁棒控制相关研究背景