职位描述
模块方向:具身大模型方向
课题方向:人形机器人交互式强化学习
方向内容:样本效率与真实物理的矛盾。通过人类反馈等高效监督,解决传统真机RL时间和经济成本太高的问题。
奖励函数的 "对齐难题"。开放式任务面临reward hacking问题、稀疏奖励问题。
安全探索的硬约束。探索过程中面临损坏等风险。
岗位职责
高效交互式 RL 算法研究。基于大模型先验的样本提效探索,离线 RL + 在线微调的混合范式,高效冷启动。
人类反馈对齐与交互式奖励建模。设计支持多模态人类反馈的奖励学习框架,研究大语言模型作为 "奖励评论家"(Reward Critic)的方案。
安全强化学习与约束探索。设计人形机器人安全探索框架,研究不确定性估计与风险敏感策略。任职要求
专业要求:
计算机、自动化、机器人、数学等相关专业硕士及以上学历
深入掌握强化学习理论,精通 PPO、SAC、离线 RL、偏好学习等核心算法
有 RL 算法从 0 到 1 的实现经验,不只是调库,而是能推导公式、改写底层
加分项:
有人形机器人 / 机械臂 RL 真实部署经验,踩过 sim-to-real 的坑
有人类反馈强化学习(RLHF)、偏好学习、逆强化学习相关研究
熟悉最优控制、轨迹优化、MPC 等经典机器人控制方法
有安全 RL、约束优化、鲁棒控制相关研究背景