职位描述
1. 核心算法研发: 负责基于视觉的高质量三维重建算法研发,重点攻克基于 3D Gaussian Splatting (3DGS) 的场景/物体表示。
1. 语义化重建与编辑:结合 CLIP, SAM (Segment Anything Model) 等 2D 视觉大模型,研发 语义三维重建 算法,赋予 3D 场景/物体细粒度的语义标签(Open-Vocabulary 3D Scene Understanding)。
2. 负责 4DGS/Mesh 的语义编辑功能 开发,实现通过文本或语义掩码对 3D 场景进行物体移除、纹理风格迁移、几何形变(Deformation)及 Inpainting 等操作。
3. 生成式重建: 探索并落地 生成式三维重建 技术路径,结合 Diffusion Model 与 3D 表征,实现从稀疏视角或文本/图像到高保真 3D 资产的生成。
4. 世界模型构建: 参与构建 闭环世界模型,利用语义重建技术搭建具备物理属性和语义理解的仿真环境,支持自动驾驶或具身智能的训练。
5. 工程落地: 追踪学术界最新成果(如 LangSplat/LangSplatV2, GaussianEditor, Worldsplat 等),将算法转化为高性能的工程模块,优化显存与实时性。任职要求
1. 学历与基础: 计算机/数学相关专业博士学历,精通 Python/C++ 及 PyTorch,具备扎实的数学与图形学基础。
2. 视觉三维重建基础:深刻理解多视图几何(MVS, SfM, SLAM),精通 3D Gaussian Splatting 原理及代码实现,熟悉其致密化、剪枝及渲染管线。
3. 语义理解与编辑经验:具备 3D 语义理解相关经验,熟悉如 LangSplat,LangSplatV2 等将 2D 特征场(Feature Field)蒸馏到 3D 空间的相关算法。有 3D 编辑算法开发经验,熟悉 Mesh 处理算法(Laplacian Smoothing, Deformation)或 3DGS 的场景编辑技术(GaussianEditor 等)。熟悉 SAM, CLIP, DINO 等视觉基础模型在 3D 任务中的应用。
4. 生成式模型经验:有生成式重建经验(WorldSplat)。熟悉 Latent Diffusion Model 原理。
(加分项):
1. 有 闭环世界模型 (Closed-loop World Model) 经验,理解如何利用语义信息构建可交互的仿真环境。有自动驾驶数据闭环开发经验者优先
2. 顶会论文: 在 CVPR/ICCV/SIGGRAPH 等发表过关于 3D Semantic Segmentation, 3D Editing, 或 Generative 3D 相关的论文。
3. 引擎交互: 熟悉 Isaac/Blender,有开发过基于语义交互的 3D 编辑工具或插件经验。高性能计算: 具备极强的 CUDA 算子手写与优化能力,能解决大规模语义特征场带来的显存压力。