Ivyea Jobs 5948 roles · 69 companies · 1 小时前
生数科技 · AI 应用

VLM视频理解算法工程师(流式视频生成)

北京 社招 · 全职 多模态 / 视觉 / 语音

职位描述

1、负责 PE Model、Caption Model、Reward Model 三类 VLM 的训练与优化,基于千卡级算力进行大规模模型训练,探索 SFT、RL、Agentic RL 等训练方法,持续提升模型在视频理解、视频描述和视频质量评价等任务上的能力,训练业界 SOTA 的视频理解 VLM 和流式视频理解 VLM; 2、负责 VLM Agent 的设计与训练,探索 VLM 在复杂视频理解任务中的 Agent 化能力,包括任务规划、工具调用、多轮推理、长视频分析等,结合 Agentic RL 等方法提升模型复杂任务的自主推理与问题解决能力; 3、负责三类 VLM 的训练数据构建与优化,针对视频理解、视频描述、视频质量评价等任务,通过规则匹配、自动化方法及外包标注团队进行数据筛选、标注和质检,持续提升训练数据的规模与质量,并探索适用于 Agentic RL 的训练数据与反馈信号构建方法; 4、负责三类 VLM 的 Benchmark 构建与迭代,设计评测任务、评测数据和评价指标,建立完善的模型评测体系,通过 Benchmark 定位模型能力短板,指导模型训练、数据和 Agent 策略迭代; 5、负责 PE Model、Caption Model、Reward Model 的 System Prompt、推理策略及使用方案优化,根据模型能力和具体任务持续调整 Prompt 与推理策略,探索 VLM Agent 的任务规划、工具调用和多步推理策略,充分挖掘模型能力; 6、围绕模型训练效果建立「数据 → 训练 → Agent → 评测 → 优化」闭环,持续探索视频理解 VLM 的 Scaling、RL 和 Agentic RL 等方向,推动模型能力达到业界领先水平。

任职要求

1、专业:计算机、人工智能、软件工程、电子信息等相关专业; 2、VLM训练经验:具备 VLM/LLM 的大规模训练经验,熟悉 SFT、RL 等训练方法,理解数据、训练策略与模型能力之间的关系;有视频理解、多模态大模型训练经验者优先; 3、Agent / RL 能力:了解或具备 VLM Agent、Agentic RL、RLHF、RLAIF、Reward Model 等相关经验,理解 Agent 训练、奖励设计、轨迹采样和策略优化等基本方法;有实际 Agent 训练或复杂推理任务优化经验者优先; 4、模型优化能力:熟悉 VLM 的训练与推理流程,具备较强的模型效果分析和问题定位能力;有 PE Model、Caption Model、Reward Model 相关经验者优先; 5、数据与评测能力:具备 VLM 数据构建、数据标注、数据质检或 Benchmark 构建经验,能够从模型效果出发反向分析数据问题并设计针对性的优化方案; 6、其他加分项:有顶会论文;熟悉主流 VLM、强化学习、Agent、视频理解模型及视频生成模型,对 VLM Scaling、RL、Agentic RL 等方向有深入理解,并具备较强的独立研究和问题分析能力。