Ivyea Jobs 8169 roles · 112 companies · 刚刚
面壁智能 · 大模型

VLM 算法实习生-多模态 Caption 与强化学习对齐

职位描述

1、VLM 精细化 Caption 能力优化: 负责大规模多模态模型(VLM)的描述生成能力进化。构建高精度视觉描述 Pipeline,重点提升模型对空间几何关系、多目标交互及复杂场景细节的感知精度,解决 VLM 在生成长描述时的“视觉幻觉”问题; 2、视觉-语言偏好对齐 (VLM + RL): 应用 RLHF/DPO 或 PPO 技术,针对视觉描述质量构建 Reward Model。通过自动化对齐技术(AI-as-Judge)或专家反馈,训练模型在受限约束下探索最优描述策略,确保输出符合高标准的严谨性与信息密度。

任职要求

1、专业背景:计算机、计算机视觉、人工智能相关专业本科及以上学历。 2、算法深度:深度理解 VLM 架构(如 Clip-vit, MoE-VLM 等)及 强化学习(RL) 训练机制;有 Reward Model 设计与偏好对齐实战经验者优先。 3、工程能力:精通 PyTorch,具备构建大规模图像-文本数据处理 Pipeline 的经验,熟悉多模态模型高效微调技术。 4、实战经验:在 Image/Video Captioning 或多模态 Agent 领域有深入研究,对提升描述准确性与抑制幻觉有成熟的技术路线。 5、学术背书:在 CVPR/ICCV/NeurIPS/ICLR 等顶级会议发表过相关论文者优先。 你将获得 挑战感知极限:利用 RL 闭环解决 VLM 最核心的语义对齐难题,打造具备“专家级”观察力的多模态模型。
面壁智能去官方页面投递 →