原力灵机去官方页面投递 →
">
职位描述
岗位名称
强化学习算法工程师(VLA 大模型后训练方向)
Reinforcement Learning Engineer – VLA Post-Training
岗位职责
负责 Vision-Language-Action(VLA)模型的强化学习后训练(Post-Training),提升模型在真实或仿真环境中的决策能力与任务成功率。
设计并实现 基于人类示范、奖励模型或规则约束的强化学习算法(如 RLHF、RLAIF、Offline RL、On-policy RL)。
构建和维护 具身智能任务环境(仿真或真实机器人),包括状态表示、动作空间、奖励函数与评估指标。
将视觉、语言理解与动作执行有效结合,优化多模态策略学习与长时序任务规划能力。
与感知、VLM、机器人控制团队协作,完成 策略部署、闭环训练与性能回归分析。
分析训练过程中的失败案例,改进奖励设计、探索策略和稳定性。
跟踪并复现前沿研究(如 VLA、Embodied AI、Robot RL、LLM + RL),推动算法落地。任职要求
计算机科学、人工智能、自动化、机器人等相关专业硕士及以上学历(优秀本科亦可)。
扎实的 强化学习基础,熟悉 PPO、SAC、DDPG、TD3、Offline RL 等主流算法。
熟悉深度学习与多模态模型,有 Vision / Language / Action 联合建模经验者优先。
具备 Python 编程能力,熟悉 PyTorch / JAX 等深度学习框架。
有 机器人控制、仿真环境(如 MJX,IsaacLab,ManiSkill3)或真实机器人实验经验者优先。
具备良好的问题拆解能力和实验分析能力,能独立推进复杂训练流程。
良好的团队协作与技术文档撰写能力。
立即投递