职位描述
项目背景:构建下一代通用具身智能系统。面向灵巧手和机械臂,打造具备高度泛化性的"通用大小脑"架构,以及用户生态友好的低门槛开发平台。团队正在快速扩充中,以助力数万台交付为目标。
多模态感知系统开发:设计并实现融合 RGB、深度、点云、触觉等多模态信息的感知系统,为操作策略提供精准的场景理解与物体状态估计。
物体/场景三维重建算法:设计并实现物体场景的高精度三维重建算法,支持机器人的高精度三维感知能力。
物体位姿估计与跟踪:开发针对已知/未知物体的 6DoF 位姿估计、类别级位姿估计、以及动态跟踪算法,支持灵巧操作中的精准抓取与放置。
场景理解与语义分割:构建面向操作场景的实时语义理解模块,包括可抓取区域检测、接触面估计、遮挡推理等。
触觉感知与力反馈:结合触觉传感器信号,开发接触状态检测、滑动检测、物体属性估计(刚度、纹理等)算法。
感知模块的轻量化部署:针对机载算力约束,完成感知模型的蒸馏、量化与部署优化,确保满足操作策略对感知延迟的要求。任职要求
计算机视觉基础:扎实的 3D 视觉基础、多视图几何,熟悉 SLAM、点云处理、位姿估计、深度估计等方法。
多模态融合:有视觉-触觉、视觉-语言等多模态融合经验,了解 CLIP、SigLIP
等视觉编码器的使用与微调。
深度学习框架:精通 PyTorch,熟悉主流视觉 backbone(ViT、DINOv2、SAM)的使用与适配。
传感器系统:熟悉 RGB-D 相机(RealSense、ZED)标定与使用,了解触觉传感器的数据处理。
工程能力:具备良好的 Python/C++ 编程能力,熟悉 ROS/ROS2,有感知模块工程化部署的经验。
有 3D 视觉、机器人感知、计算机视觉等相关领域实习经验。