职位描述1、研发多模态理解模型:视觉-语言对齐、视频理解、场景语义/事件理解、指代消解; 2、攻关应用场景难点:开放世界泛化、长尾物体、复杂指代(那个/旁边/刚才); 3、输出结构化语义表示:对象/属性/关系/事件/可操作性(affordance)等,便于规划调用; 4、建立评测与数据策略:线上失败归因、难例回流、版本对比与回归测试; 5、与Agent/规划/VLN协同,围绕任务成功率与稳定性闭环优化;任职要求1、熟悉 Transformer 基础与多模态基本范式(对齐、融合、token/embedding、评测); 2、图文检索、grounding、VQA、视频理解、指代表达理解等任一方向科研背景; 3、能使用 PyTorch 复现 VLM/Video Understanding 相关工作,具备数据处理与训练经验; 加分项 - 具身语义/导航语义理解经验; - 数据合成、自动标注、弱监督经验; - 顶会论文/专利/高质量开源复现或贡献。