职位描述
项目背景:构建下一代通用具身智能系统。面向灵巧手和机械臂,打造具备高度泛化性的"通用大小脑"架构,以及用户生态友好的低门槛开发平台。团队正在快速扩充中,以助力数万台交付为目标。
灵巧操作强化学习算法开发:针对灵巧手抓取、旋转、工具使用等高难度操作任务,设计并实现高效的 RL 训练方案,包括奖励函数设计、课程学习策略、稀疏奖励塑形等。
Sim-to-Real 强化学习框架:搭建并维护基于大规模并行仿真的 RL 训练框架,实现从仿真到真机的高效策略迁移,包括域随机化、系统辨识、Real2Sim2Real 等关键技术。
具身基础模型 RL 后训练:围绕 VLA/WAM 等具身基础模型,研究 RLT、π-RL、LWD、 Q-Guided Flow 等流匹配策略与价值函数融合方法,提升预训练策略的泛化与极限性能。
人类反馈强化学习(RLHF/HIL):设计并实现基于人类反馈或人类介入的
在线学习系统,支持策略在真机交互中的持续进化。
多任务/多技能/层次化策略学习:研究多任务 RL、技能组合、Hierarchical RL、单策略覆盖多种操作技能的高效学习。
RL 训练基础设施建设:构建高吞吐的 RL 训、pipeline,包括异步采样、分布式训练、超参搜索平台、可视化与可观测性等,支撑团队算法快速迭代。任职要求
强化学习理论与实践:精通主流 RL 算法(PPO、SAC、DQN 等),深刻理解 on-policy/off-policy、model-based/model-free、online/offline 的设计取舍与可扩展性挑战。
机器人 RL 工程经验:熟悉面向机器人的 RL 挑战(连续动作空间、稀疏奖励、安全约束、长程任务),熟悉 Residual RL、LoRP(Low-rank Residual Policy)、DAPG 等实用技巧。
仿真 RL 环境开发:精通主流仿真引擎,能独立搭建灵巧操作任务环境、设计奖励与课程;熟悉 sim2real 域随机化与系统辨识。
编程与工程:精通 Python 与 PyTorch:有大规模并行 RL 训练经验(≥1024环境并行)。
有强化学习、机器人学习、具身智能、大模型 RL 等相关领域实习经验。