Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

具身智能算法研究员

上海 社招 · 全职 具身智能 / 机器人

职位描述

岗位定位 我们正在寻找在三维感知、机器人学习、多模态大模型或数据预训练等方向有深厚积累的算法研究员。你将与团队一起构建具身智能体的“大脑”与“空间智能”,负责从环境理解、世界建模到端到端决策、仿真迁移的核心算法研发,最终将模型部署到真实机器人上完成复杂任务。 岗位职责(入职后将聚焦其中1~2个方向) 方向一:空间智能与三维重建 - 研发前馈式(Feedforward)3D Gaussian Splatting 场景重建算法,从稀疏多视角或单目视频毫秒级输出紧凑3D高斯表示,支持动态更新与压缩。 - 构建实时SLAM系统(融合传统/NeRF/3DGS方法),处理自我中心(egocentric)与人中心(exocentric)混合输入,输出机器人坐标系下的稠密几何、物体6DoF位姿及相机轨迹。 - 开发人体-物体交互(HOI)重建:从多视角外部视频重建物体网格+姿态、人体SMPL/手部MANO参数;从单目自我中心视频实时重建手部与接触关系,生成时空对齐的HOI轨迹。 - 设计自动标定与数据预处理管线(多相机外参自标定、时间同步、空间对齐),为下游模型提供规范化输入。 - 向端到端模型输出可消费的空间Token(如场景图序列、可操作实体列表、接触点坐标),并与RL组协同提供动态场景下的状态预测(世界模型)。 方向二:VLA端到端模型与RL后训练 - 设计并训练视觉-语言-动作多模态Transformer(参考RT-2、Octo、PaLM-E),输入自然语言指令 + 空间Token + 本体感觉,输出离散/连续动作Token(关节角度、末端位姿或扩散策略)。 - 优化模型在真机上的推理速度与泛化能力,探索不同动作表示与模型压缩技术。 - 利用仿真环境(Isaac Sim、Mujoco)对VLA模型进行强化学习微调(PPO/SAC/RLPD),解决域迁移导致的分布漂移。 - 设计域随机化、系统辨识、扰动注入策略,提升策略在真实机器人上的成功率与平滑度。 方向三:预训练、Omni大模型与数据策略 - 利用大规模人类视频(Ego4D、Open X-Embodiment)及无本体交互数据,预训练多模态基座模型(视觉-语言-动作联合),作为VLA主干backbone。 - 探索scaling law,设计模型架构(如Transformer、DiT)与预训练任务(MAE、动作预测、对比学习)。 - 基于VLM/VLA大模型构建自动标注管线,对视频、轨迹、触觉信号进行结构化标注(动作阶段、接触事件、成功/失败标签),降低人工成本。 - 设计主动学习策略,从海量数据中筛选高价值样本(失败轨迹、长尾场景)。 - 牵头制定数据混合策略:真机遥操作数据 : 无本体人类视频 : 仿真合成数据的最优比例,设计消融实验验证,建立数据价值评估模型。

任职要求

- 计算机视觉、机器人学、机器学习、图形学等相关专业硕士及以上学历,博士优先。 - 在以下至少一个方向有深入研究和项目经验: - 三维重建/SLAM/3D Gaussian Splatting/物体姿态估计/人体手部重建 - 模仿学习(BC、ACT、Diffusion Policy)、强化学习(PPO、SAC)、机器人控制(MPC、力控)、VLA架构(RT-2、PaLM-E等) - 多模态预训练(CLIP、LLaVA)、大模型微调(LoRA、RLHF)、自动标注、数据合成与数据策略 - 扎实的编程能力:精通Python,熟悉C++,熟练使用PyTorch/JAX等深度学习框架。 - 熟悉至少一种仿真器(Isaac Sim、Mujoco、PyBullet)或真实机器人平台。 - 具备优秀的学习能力、逻辑思维与跨团队协作精神,能够快速将前沿论文转化为可工作的原型。 加分项 - 有真实机器人(机械臂、人形、四足)部署经验,特别是高复杂度操作任务(装配、双手协作)。 - 在CVPR/ICCV/ECCV/CoRL/ICRA/RSS/NeurIPS等顶会发表论文,或有高质量开源贡献。 - 处理过Ego4D、HoloAssist或自采机器人混合数据,有Sim2Real迁移实战经验。 - 熟悉ROS/ROS2,有实时系统或嵌入式开发经验。