职位描述
岗位职责
负责视觉语言模型(VLM)及多模态大模型相关算法研发,面向图像、视频等视觉内容进行场景理解、语义理解、空间关系理解及复杂事件理解。
负责 AI Agent 感知能力建设,包括视觉感知、场景理解、用户意图理解、环境状态建模及面向 Agent 决策的结构化信息抽取。
探索 VLM 在 AI 摄影、智能交互、终端 Agent 等场景中的应用,将视觉理解能力转化为可执行的 Agent 感知与决策能力。
负责 VLM 的 SFT、RL/Preference Optimization、Prompt/Inference Optimization 等训练与优化工作,持续提升模型在真实业务场景中的准确性、泛化性和鲁棒性。
构建多模态数据体系,包括数据采集、清洗、标注、难例挖掘、合成数据及自动化评测体系,并针对模型 Bad Case 持续迭代。
负责 VLM 在真实终端场景中的部署与优化,关注模型 精度、推理延迟、显存/内存、功耗 等指标,推动算法从实验室走向产品量产。
跟踪 VLM、Multimodal Agent、Vision Agent、Reasoning 等前沿技术,结合业务场景进行技术预研和落地。任职要求
计算机、人工智能、电子信息、自动化等相关专业,硕士及以上学历。
具备扎实的深度学习和计算机视觉基础,熟悉 Transformer、ViT、LLM/VLM 等主流模型架构。
熟悉 VLM/多模态模型训练与微调方法,有 SFT、RLHF、DPO、GRPO 等实际经验者优先。
对视觉理解、图像/视频理解、空间关系、场景理解等方向有较深入研究,具备较强的问题抽象和算法设计能力。
熟悉 PyTorch,具备大模型训练、推理及工程优化能力,有多卡训练经验。
有 Agent、Tool Calling、Function Calling、Reasoning、Memory、Planning 等相关研发经验者优先。
有端侧大模型、手机影像、Camera、ISP、NPU/AI Engine 等实际落地经验者优先。
有较强的论文阅读和技术创新能力,能够快速跟进并复现前沿工作。
加分项
有优秀的 VLM / MLLM / Agent 相关论文、开源项目或竞赛成果;
有 Qwen-VL、InternVL、LLaVA、Gemini、GPT-4o 等多模态模型训练或应用经验;
有图像/视频理解 Benchmark 构建及模型评测经验;
有 AI 摄影、智能相机、视觉 Agent、机器人视觉等项目经验;
有从 数据 → 训练 → 评测 → 部署 → 产品完整闭环经验。
立即投递