职位描述1、负责单目视频3D 人体动作捕捉算的研发、迭代与工程化落地,创新灵创平台的核心能力;包括 2D/3D 姿态估计、mesh 重建、SMPL/SMPLX参数回归、时序优化等; 2、参与构建机器人交互智能的空间感知算法体系:人体跟踪、骨骼估计、深度估计、场景理解、空间语义理解等; 3、研发物体检测与位姿估计算法(6D Pose Estimation),支持未来多模态交互与场景互动能力; 4、与动作生成模型、运控团队协作,推进“感知 → 结构化动作表征 → 机器人可执行动作”的全链路技术方案; 5、探索并落地多模态感知技术(视频/深度/IMU/音频等融合)用于机器人交互场景; 6、跟踪视觉计算与 3D 人体理解领域前沿研究,为平台产品提供持续的技术创新能力;任职要求1、计算机视觉、人工智能、机器人等相关专业硕士及以上学历; 2、在以下至少两个方向具备深入研究经验: 1)3D 人体姿态估计 / SMPL-X 参数估计 2)视频到动作(Video-to-Motion)动作重建 3)多视角融合、单目深度估计、3D Reconstruction 4)物体 6D 位姿估计(Pose Estimation / Keypoint / ICP / PnP) 5)时序动作优化(Kalman / smoother / VAE / diffusion) 6)扎实的机器学习与深度学习基础,熟练使用 PyTorch / TensorFlow。 3、有扎实的数学基础(线性代数、优化、几何视觉、多视图几何); 加分项 1、有 3D 检测 / 跟踪 / 动作捕捉 相关论文发表(CVPR/ICCV/ECCV/TPAMI/TVCG); 2、有动作重定向(Retargeting)、IK/FK、多体动力学经验; 3、有 Diffusion/Transformer 用于 3D 动作理解与生成相关经验; 4、有机器人感知、视觉伺服、场景交互项目经验; 5、熟悉数字人、虚拟主播、视频驱动角色动画(Vtuber / mocap / avatar); 6、对 Real-time、low-latency 推理有优化经验。