职位描述
1、负责设计端到端的视觉SLAM,融合几何与数据驱动模型,重点突破动态、重复环境下的定位与建图难题。
2、负责基础模型研究与落地,考虑VGGT(Visual Geometry Grounded Transformer)、DROID-SLAM等基于学习/Transformer的模型,提升泛化能力和几何一致性。
3、设计时空记忆与认知建图,构建具备长期数据关联能力的时空记忆模块,负责语义SLAM与场景理解算法的研发,使机器不仅能“定位”,更能“理解”空间中的物体、状态与动态变化。
4、负责多模态融合与开放世界感知,探索视觉语言模型(VLM)、SAM3等大模型与SLAM系统的结合点,实现开放词汇的物体级建图与基于自然语言的空间查询。
5、跟踪国际前沿技术(如3D Gaussian Splatting、NeRF-SLAM、视觉基础模型、多模态大模型)。任职要求
1、 计算机视觉、机器人学等相关专业博士学历。
2、深刻理解多视图几何、非线性优化(g2o, Ceres, GTSAM)、滤波理论(EKF, PF),不依赖开源框架也能手推公式。
3、精通的C++/Python编程,熟练使用PyTorch/TensorFlow,具备扎实的工程落地能力(代码效率、内存管理、CUDA优化)。
4、有基于学习的SLAM系统(如DROID-SLAM, DeepFactors)或深度视觉里程计的深度优化或重构经验。
5、必须深入理解VGGT等基于Transformer的几何视觉模型,并有将其应用于SLAM前端的经验或明确思路。
加分项
1、具有语义SLAM或动态SLAM实际落地经验,能够处理非结构性变化场景。
2、有构建长期数据关联(Lifelong SLAM)、基于图神经网络(GNN)的时空记忆网络经验,能够解决大规模场景下的地图复用与增量更新问题。
3、熟悉视觉语言模型(VLM)、SAM(SAM2),有将其引入SLAM系统实现开放词汇(Open-Vocabulary)建图或自然语言交互式导航的实践经验。
4、在CVPR/ICCV/ECCV/ICRA/IROS等顶会发表过论文,特别是在Learning for SLAM、3D场景理解方向。
5、熟悉视觉与IMU、轮速计等传感器的学习型融合策略。