Ivyea Jobs 10689 roles · 175 companies · 刚刚
元戎启行 · 具身智能

Feed-forward Reconstruction/视觉 4D 重建算法工程师

职位描述

岗位定位: 负责基干多视角相机视频和 Feed-forward Reconstruction 视觉大模型,构建自动驾驶动态与静态 4D 重建能力,为 OCC、BEV感知、3DGS仿真、World Model训练提供高质量几何真值和时序一致的世界状态表征。该岗位重点关注以 VGGT、Pi3、Depth Anything V3、DUSt3R、MASt3R 等为代表的新一代视觉几何基础模型,通过前馈式网络直接预测多视角depth、camera pose、point map、track、flow、动态物体结构与静态场景几何。 核心职责: 负责基于 Feed-forward Reconstruction、视频几何基础模型、多视角深度估计、相机位姿估计、点云预测、动态场景重建等技术路线的自动驾驶 4D 重建算法研发。 跟进并复现 VGGT、Pi3、Depth AnythingV3、DUSt3R、MASt3R、FastVGGT、LiteVGGT、CoTracker、TAPIR等前沿视觉几何模型,并结合自动驾驶多相机数据进行训练、微调、蒸和工程落地。 建设自动驾驶静态环境重建能力,包括道路、车道线、路沿、交通设施、建筑结构、可行驶区域、背景点云、局部几何拓扑等。 建设动态目标重建能力,包括车辆、行人、骑行者等交通参与者的三维结构、轨迹、速度、运动状态、可见性关系和时序一致性建模。 解决自动驾驶多视角重建中的遮挡、反射、远距离稀疏结构、动态拖影、rolingshutter、时间同步、标定误差、多相机一致性等问题。 将 Feed-forward Reconstruction结果转化为可用于0CC/BEV/Depth/Flow3D/Pose/3D Detection/3DGS/World Model等任务训练的高质量真值。 构建视觉重建自动化评测体系,评估 depth accuracy、pose accuracy、point cloud accuracy、track consistency、flow consistency、temporal consistency、dynamic consistency、multi-view consistency等指标。 与动态 GT、Depth GT、3DGS仿真、Difusion修复、World Model团队协作,打通从视觉重建到神经渲染、生成式修复和闭环仿真的完整数据生产链路。

任职要求

硕士及以上学历,计算机视觉、机器人、自动驾驶、人工智能、自动化等相关专业。 具备2年以上三维重建、多视角几何、深度估计、相机位姿估计、SLAM、SfM/MVS、动态场景重建、视觉基础模型或自动驾驶真值生产相关经验。 熟悉Feed-forward Reconstruction 技术路线,深入理解VGGT、Pi3、DepthAnythingV3、DUSt3R、MASt3R、FastVGGT、LiteVGGT 等相关工作中的至少两类。 熟悉多视角 depth/pose/point map/optical flow/point tracking/dynamic reconstruction /video geometry 等任务中的至少三类。 熟悉相机模型、坐标变换、PnP、Bundle Adjustment、EpipolarGeometry、多相机标定、时间同步、长序列优化等几何基础。 具备PyTorch 深度学习训练经验,能够独立完成模型复现、数据构建、训练调参、评测分析、模型优化和工程部署。 必须具备相关项目经历,包括Feed-forward Reconstruction、多视角深度估计、相机位姿估计、动态场景重建、纯视觉三维重建、视频几何基础模型训练、自动驾驶视觉真值生产等。 优先条件: 有VGGT、Pi3、Depth Anvthing V3、DUSt3R、MASt3R、FastVGGT、LiteVGGT等视觉几何基础模型复现、训练、微调或工程落地经验者优先。 有自动驾驶多相机重建、长序列重建、动态物体重建、纯视觉 4D Label生产经验者优先。 有前馈式 depth/pose/point map/track/flow联合建模经验者优先。 有大规模云端视觉重建系统、自动化真值生产系统、训练数据生产系统经验者优先。 有CVPR/ICCV/ECCV/NeUrIPS/ICML/SIGGRAPH/ICRA相关论文或开源项目者优先。 立即投递
元戎启行去官方页面投递 →