Ivyea Jobs 6520 roles · 89 companies · 刚刚
光轮智能 · 具身智能

具身大脑 - 视频理解VLM算法Lead

上海 社招 · 全职 多模态 / 视觉 / 语音

职位描述

定义下一代具身事件与动作理解的VLM算法。 岗位亮点 你将负责具身智能训练数据中的语义理解主线,围绕动作解析、任务意图、对象属性、操作关系、目标区域等关键信息,建设可规模化的语义数据生产体系。 这个岗位会直接影响语义数据质量、结构化程度以及下游模型的训练效果。 工作内容 1. 负责图像、视频和多模态信号中的语义理解、动作解析与结构化标签生成主线建设。 2. 负责 VLM / MLLM 在自动化标注场景中的落地,包括提示设计、结果解析、质量过滤和结构化输出。 3. 负责语义标签体系、动作词表、描述规范和一致性策略建设,推动语义数据从“可读”走向“可训练、可交付、可回归”。 4. 与几何、数据质量、训练评测团队协作,共同构建高质量多模态训练数据。 5. 负责语义方向的难例分析、质量评测和迭代优化,持续提升结果稳定性和训练价值。 6. 推动语义生产从单点模型能力走向工程化、平台化和规模化。

任职要求

任职要求 1. 计算机、人工智能、机器学习、模式识别等相关专业,硕士及以上学历。 2. 具备视频理解、动作识别、语义解析、VLM / MLLM 训练微调经验。 3. 做过自动化标注、训练数据构建、标签体系设计、数据治理或结构化数据生产相关工作。 4. 熟悉 Python、PyTorch 及主流多模态模型框架,具备较强工程落地能力。 5. 能把语义理解能力真正落到数据生产流程里,而不是只做离线模型研究。 6. 具备较强 owner 意识,愿意对一条语义数据主线的结果负责。 加分项 1. 做过 egocentric 视频理解、动作语义建模、结构化语义标注。 2. 做过人类视频到机器人训练数据的转换与标签生成。 3. 做过 VLM / MLLM 在生产场景中的工程化落地。 4. 做过自动化验收、质量回流、语义一致性治理或数据质量平台建设。
光轮智能去官方页面投递 →