职位描述岗位目标:让机器人“看懂场景、理解指令、做对回应”,提升交互与任务执行可靠性。 岗位职责 - 研发多模态理解模型:视觉-语言对齐、视频理解、场景语义/事件理解、指代消解 - 攻关应用场景难点:开放世界泛化、长尾物体、复杂指代(那个/旁边/刚才) - 输出结构化语义表示:对象/属性/关系/事件/可操作性(affordance)等,便于规划调用 - 建立评测与数据策略:线上失败归因、难例回流、版本对比与回归测试 - 与Agent/规划/VLN协同,围绕任务成功率与稳定性闭环优化任职要求- 熟悉 Transformer 基础与多模态基本范式(对齐、融合、token/embedding、评测) - 图文检索、grounding、VQA、视频理解、指代表达理解等任一方向科研背景 - 能使用 PyTorch 复现 VLM/Video Understanding 相关工作,具备数据处理与训练经验 加分项 - 具身语义/导航语义理解经验 - 数据合成、自动标注、弱监督经验 - 顶会论文/专利/高质量开源复现或贡献