Ivyea Jobs 5948 roles · 69 companies · 刚刚
优必选 · 具身智能

时空记忆工程师/研究员

深圳 校招 · 全职 “算”力MAX类 研究 / 科学

职位描述

1、负责设计端到端的视觉SLAM,融合几何与数据驱动模型,重点突破动态、重复环境下的定位与建图难题。 2、负责基础模型研究与落地,考虑VGGT(Visual Geometry Grounded Transformer)、DROID-SLAM等基于学习/Transformer的模型,提升泛化能力和几何一致性。 3、设计时空记忆与认知建图,构建具备长期数据关联能力的时空记忆模块,负责语义SLAM与场景理解算法的研发,使机器不仅能“定位”,更能“理解”空间中的物体、状态与动态变化。 4、负责多模态融合与开放世界感知,探索视觉语言模型(VLM)、SAM3等大模型与SLAM系统的结合点,实现开放词汇的物体级建图与基于自然语言的空间查询。 5、跟踪国际前沿技术(如3D Gaussian Splatting、NeRF-SLAM、视觉基础模型、多模态大模型)。

任职要求

1、 计算机视觉、机器人学等相关专业博士学历。 2、深刻理解多视图几何、非线性优化(g2o, Ceres, GTSAM)、滤波理论(EKF, PF),不依赖开源框架也能手推公式。 3、精通的C++/Python编程,熟练使用PyTorch/TensorFlow,具备扎实的工程落地能力(代码效率、内存管理、CUDA优化)。 4、有基于学习的SLAM系统(如DROID-SLAM, DeepFactors)或深度视觉里程计的深度优化或重构经验。 5、必须深入理解VGGT等基于Transformer的几何视觉模型,并有将其应用于SLAM前端的经验或明确思路。 加分项 1、具有语义SLAM或动态SLAM实际落地经验,能够处理非结构性变化场景。 2、有构建长期数据关联(Lifelong SLAM)、基于图神经网络(GNN)的时空记忆网络经验,能够解决大规模场景下的地图复用与增量更新问题。 3、熟悉视觉语言模型(VLM)、SAM(SAM2),有将其引入SLAM系统实现开放词汇(Open-Vocabulary)建图或自然语言交互式导航的实践经验。 4、在CVPR/ICCV/ECCV/ICRA/IROS等顶会发表过论文,特别是在Learning for SLAM、3D场景理解方向。 5、熟悉视觉与IMU、轮速计等传感器的学习型融合策略。