职位描述
岗位定位
聚焦「Ego视角数据二次提取 → 高保真仿真环境构建 → RL策略训练 → Sim2Real真机部署」全链路。负责面向多指灵巧手的强化学习仿真系统研发与算法工程化落地。打通从Ego采集数据中提取操作先验、构建接触密集型物理仿真环境、设计高效RL训练范式,最终实现高成功率、强泛化性的灵巧操作策略,并稳定迁移至真机DexHand系统。任职要求
任职要求
学历与经验
本科及以上学历,计算机科学、人工智能、机器人学、自动化、控制工程等相关专业
1年及以上 强化学习/机器人仿真/灵巧手控制算法研发经验;或硕博具备完整 RL4DexterousHand 项目落地经历
熟悉机器人产品/算法迭代流程,具备从仿真到真机部署的工程闭环能力
Ego数据二次提取与状态重构
精通从Ego视角视频/遥操作数据中提取RL可用状态表征:
手部/指尖6D位姿重建、物体姿态跟踪、接触点/滑移状态估计
遮挡/运动模糊/反光场景下的时序一致性处理与不确定性建模
多模态对齐:视觉特征 ↔ 本体感知 ↔ 力/触觉信号的跨模态映射
熟悉数据到RL状态空间的转换逻辑:
降维与特征编码(VAE/Contrastive/Proprioceptive Embedding)
相对位姿/接触拓扑/操作阶段(Phase)的结构化表示
离线数据清洗、轨迹插值、动作平滑与专家示范提取(BC预训练数据准备)
仿真环境与物理建模
精通主流机器人仿真引擎:
Isaac Sim / Isaac Lab(GPU并行仿真、PhysX 5接触模型、USD资产管线)
MuJoCo / PyBullet(高精度接触求解、柔性体/线驱动建模、二次开发)
掌握多指灵巧手高保真建模:
肌腱/线驱动运动学映射、关节柔性/迟滞补偿、碰撞几何优化
接触物理参数调优(摩擦锥、恢复系数、穿透容忍度、微滑移建模)
传感器仿真:RGB-D/事件相机渲染、关节编码器噪声注入、六维力/指尖触觉仿真
熟悉仿真环境自动化构建:Gymnasium接口封装、场景随机化、任务配置管理、批量验证流水线
强化学习算法与训练策略
精通主流RL算法原理与工程实现:
On-policy:PPO、TRPO(稳定性、熵正则、梯度裁剪、多环境并行)
Off-policy:SAC、TD3(重放缓冲优化、目标网络、双Q学习)
混合范式:BC预训练+RL微调、Diffusion Policy、RLHF/RLAIF对齐
精通灵巧手操作任务的奖励函数设计:
稀疏奖励塑形(Sub-goal/Phase-based/Contact-aware)
课程学习(Curriculum Learning):从静态抓取→动态操作→复杂扰动
多目标优化:成功率、能耗、平滑度、接触力约束、安全边界
具备大规模分布式训练经验:
GPU集群并行仿真(Isaac Lab/ManiSkill/Ray)、异步经验收集
显存/算力优化:混合精度、经验压缩、梯度累积、检查点管理
Sim2Real迁移与真机部署
精通仿真到真机的鸿沟跨越技术:
域随机化(Domain Randomization):视觉纹理、物理参数、传感器噪声、控制延迟
策略蒸馏/压缩:Teacher-Student架构、动作空间离散化、推理加速(TensorRT/ONNX)
熟悉实时控制部署:
Jetson/工控机端低延迟推理(≤10ms)、控制频率同步(100~200Hz)
状态估计补偿:视觉延迟预测、本体感知滤波、观测器设计
安全回退机制:策略置信度评估、急停触发、共享自主(Shared Autonomy)切换
软件工程与工具链
精通 Python/C++,熟悉高性能数值计算、多线程/异步编程、跨平台开发(CMake/Bazel)
熟练掌握 PyTorch/JAX,能独立实现RL算法、自定义损失、分布式数据并行
熟悉实验管理与自动化:MLflow/W&B、Optuna超参搜索、Git/GitLab CI、Docker容器化
具备高质量代码规范:模块化设计、单元测试、类型注解、技术文档、故障复盘
加分项(优先考虑)
在 RSS/CoRL/ICRA/NeurIPS/ICLR 等顶会发表灵巧手RL/Sim2Real相关论文,或对 Isaac Lab、ManiSkill、RL4Robotics 等开源项目有核心贡献
熟悉 3DGS/NeRF 结合 RL 的状态提取,或 视觉-语言-动作(VLA)模型 微调与策略对齐
有 肌腱驱动/欠驱动/柔性指尖 灵巧手仿真经验,或接触密集型任务(旋转、插拔、柔性物体操作)落地案例
掌握 Ray/TorchRL/Stable Baselines3 等分布式训练框架,具备万级GPU小时训练调优经验
有 医疗/工业/家庭服务 场景灵巧手部署经验,理解领域约束(无菌、防爆、安全认证)
主要工作职责
设计并实现 Ego数据二次提取流水线,将原始视频/遥操作数据转换为RL可用的状态-动作序列与专家示范集
构建多指灵巧手高保真仿真环境,精准建模肌腱驱动、接触物理与多模态传感器,支撑大规模并行训练
研发面向灵巧操作的RL算法:设计奖励函数、课程学习、BC+RL混合训练范式,提升样本效率与策略鲁棒性
攻克 Sim2Real 迁移难题:通过域随机化、系统辨识、策略蒸馏与实时推理优化,实现真机高成功率部署
搭建分布式训练基础设施:支持万级并行仿真、自动化实验追踪、超参优化与模型版本管理
输出技术文档、开源代码、部署脚本,支撑产品迭代、学术转化与跨团队协作