Ivyea Jobs 5948 roles · 69 companies · 刚刚
银河通用 · 具身智能

具身agent算法工程师

北京 社招 · 全职 算法中心 / 算法类 具身智能 / 机器人

职位描述

岗位职责: 1、负责具身 Agent 核心算法的设计与迭代,涵盖任务理解与分解、规划决策、工具与 Skill 使用、记忆与上下文管理、反思纠错等关键能力。 2、参与具身 Agent OS 的算法架构设计与升级,建立感知、认知、决策、执行和反馈之间的协同机制,提升 Agent 的通用性、可扩展性、稳定性及自主决策能力。 3、面向各类具身交互场景,研究多模态感知、语言理解、环境状态建模与机器人行为决策之间的闭环算法,提升复杂、动态和不确定环境下的交互效果。 4、研究长程任务执行中的状态跟踪、动态规划、异常恢复和安全约束等问题,提高 Agent 在连续交互过程中的任务完成率与鲁棒性。 5、建设具身 Agent 的数据与评测闭环,包括交互数据采集、行为轨迹构建、能力评测、真实环境验证及失败案例分析,推动算法持续迭代。 6、开展 Agentic 模型训练与 Agentic RL 相关工作,包括训练数据构建、SFT、奖励设计、轨迹评估、策略优化和模型后训练,提升模型在具身环境中的规划、推理、工具使用与自主决策能力。

任职要求

1、计算机、人工智能、自动化、机器人或相关专业背景;不对学历和工作年限设置绝对限制,以实际能力、项目成果和研究深度为主要评价依据。 2、在以下至少一个方向具备扎实的理论基础和实践经验: 大模型 Agent 或 Agentic AI 具身智能与机器人学习 强化学习与模型后训练 规划、推理与决策算法 3、对 Agent 的任务规划、工具使用、记忆机制、上下文学习、反思纠错或自主决策等方向有深入理解,能够将算法问题转化为可验证的技术方案。 4、熟练使用 Python,熟悉 PyTorch 等深度学习框架,具备独立开展数据处理、模型训练、实验分析和算法评测的能力。 5、具备良好的沟通与协作能力,能够与机器人、感知、平台及产品团队共同推动算法落地。 加分项: 1、具备 Agentic RL、RLHF、RLAIF、PPO、GRPO 或其他策略优化方法的研究与实践经验。 2、有大模型 SFT、偏好优化、奖励模型或模型后训练经验。 3、有真实机器人上的 Agent、强化学习或多模态交互算法落地经验。 4、熟悉 VLM、VLA、世界模型、模仿学习或机器人策略学习。 5、有仿真环境、交互式训练环境或大规模行为轨迹数据建设经验。 6、在相关领域发表过高质量论文,或有具备影响力的开源项目、竞赛及产品成果。 7、对前沿 Agent 研究保持持续关注,并具备较强的算法复现与创新能力。 立即投递