职位描述
定义下一代具身事件与动作理解的VLM算法。
岗位亮点
你将负责具身智能训练数据中的语义理解主线,围绕动作解析、任务意图、对象属性、操作关系、目标区域等关键信息,建设可规模化的语义数据生产体系。
这个岗位会直接影响语义数据质量、结构化程度以及下游模型的训练效果。
工作内容
1. 负责图像、视频和多模态信号中的语义理解、动作解析与结构化标签生成主线建设。
2. 负责 VLM / MLLM 在自动化标注场景中的落地,包括提示设计、结果解析、质量过滤和结构化输出。
3. 负责语义标签体系、动作词表、描述规范和一致性策略建设,推动语义数据从“可读”走向“可训练、可交付、可回归”。
4. 与几何、数据质量、训练评测团队协作,共同构建高质量多模态训练数据。
5. 负责语义方向的难例分析、质量评测和迭代优化,持续提升结果稳定性和训练价值。
6. 推动语义生产从单点模型能力走向工程化、平台化和规模化。任职要求
任职要求
1. 计算机、人工智能、机器学习、模式识别等相关专业,硕士及以上学历。
2. 具备视频理解、动作识别、语义解析、VLM / MLLM 训练微调经验。
3. 做过自动化标注、训练数据构建、标签体系设计、数据治理或结构化数据生产相关工作。
4. 熟悉 Python、PyTorch 及主流多模态模型框架,具备较强工程落地能力。
5. 能把语义理解能力真正落到数据生产流程里,而不是只做离线模型研究。
6. 具备较强 owner 意识,愿意对一条语义数据主线的结果负责。
加分项
1. 做过 egocentric 视频理解、动作语义建模、结构化语义标注。
2. 做过人类视频到机器人训练数据的转换与标签生成。
3. 做过 VLM / MLLM 在生产场景中的工程化落地。
4. 做过自动化验收、质量回流、语义一致性治理或数据质量平台建设。