Ivyea Jobs 5948 roles · 69 companies · 刚刚
自变量机器人 · 具身智能

【27届】强化学习算法工程师

深圳 / 北京 社招 后训练 / 对齐

职位描述

岗位简介: 让基础模型(VLA、WAM 等)在 SFT 之上通过 RL 持续自我提升——摆脱人工数采,靠机器人自主采集 + 在线强化,把真实操作任务的成功率、速度与精细度一路推高,并向多任务泛化、多机大规模训练演进。 1. 单任务:在 VLA/WAM 的 SFT 基础上用 RL 进一步提升成功率与速度,并靠自主/在线采集提升精细操作的数采效率,摆脱人工遥操作依赖,形成自改进闭环。 2. 多任务:训练跨任务泛化的通用 reward/feedback 模型(VLM-as-reward、RLT 类范式),减少逐任务奖励工程。 3. 多机:探索多机器人大规模 RL——分布式在线采集、fleet 数据聚合与异步训练。 4. 真机:以上都落到真实任务上生效,保障"推理采集 → 上传 → 训练 →数据回流 "链路稳定可监控。 核心职责: 1. RL 算法与前沿复现:复现改进 HIL-SERL/SERL、RLPD、IQL/CQL、residual RL 等;设计 SFT→RL 的 post-training 方案(reward shaping、课程学习、UTD 调优)。 2. VLA/WAM + RL 微调:负责基础模型(wall-oss-0.5, wall-wm)的 RL 微调与推理优化,复现RL Token、RECAP 等工作;研发通用奖励模型, 解决多任务奖励泛化问题。 3. 真机在线 RL 闭环(核心):搭建实时/异步 inference、trajectory 采集/回放、reward 计算、HIL 接入的完整闭环,并扩展到多机规模。 4. 系统集成与 Sim2Real:基于 ROS2 部署到双臂/人形等真实平台;用 Isaac Lab 做仿真验证与 sim-to-real。

任职要求

基础:毕业时间介于2026年9月至2027年8月的国内外高校的本科生、硕士生、博士生;扎实 CS 基础(数据结构/算法/OS/Linux);熟练 Python 布式与混合精度训练经验;多机多仓库协作经验。 专业: 1. 深入理解 RL,熟悉 PPO / SAC / TD3 / IQL / CQL,了解 offline/residual/diffusion RL 与 reward shaping、课程学习、UTD 调优。 2. 熟悉 Diffusion Policy、Flow Matching、ACT 等生成式策略模型,理解 VLA/WAM 架构的预训练/微调流程。 3. 了解 world model / 基于预测的策略学习(如 world-model 和 RL 的结合方式)。 4. 熟悉 ROS2、机械臂运动学与遥操作数采;针对强化学习数据有完整的标注经验;有真机调试经验优先。 5. 有 Isaaclab 及 sim-to-real 经验;具备仿真中强化学习基础, 双臂、灵巧手操作优先。 加分项:顶会论文(NeurIPS/ICML/ICLR/CoRL/RSS/ICRA);真机 模型 / 多机分布式 RL / 自主数采经验;熟悉LeRobot、openpi;复现过 HIL-SERL、RLPD、π 系列、RLT 等或有开源贡献。