Ivyea Jobs 5948 roles · 69 companies · 刚刚
阶跃星辰 · 大模型

VLM / Agent 感知算法工程师

上海 / 北京 社招 · 全职 算法工程 多模态 / 视觉 / 语音

职位描述

岗位职责 负责视觉语言模型(VLM)及多模态大模型相关算法研发,面向图像、视频等视觉内容进行场景理解、语义理解、空间关系理解及复杂事件理解。 负责 AI Agent 感知能力建设,包括视觉感知、场景理解、用户意图理解、环境状态建模及面向 Agent 决策的结构化信息抽取。 探索 VLM 在 AI 摄影、智能交互、终端 Agent 等场景中的应用,将视觉理解能力转化为可执行的 Agent 感知与决策能力。 负责 VLM 的 SFT、RL/Preference Optimization、Prompt/Inference Optimization 等训练与优化工作,持续提升模型在真实业务场景中的准确性、泛化性和鲁棒性。 构建多模态数据体系,包括数据采集、清洗、标注、难例挖掘、合成数据及自动化评测体系,并针对模型 Bad Case 持续迭代。 负责 VLM 在真实终端场景中的部署与优化,关注模型 精度、推理延迟、显存/内存、功耗 等指标,推动算法从实验室走向产品量产。 跟踪 VLM、Multimodal Agent、Vision Agent、Reasoning 等前沿技术,结合业务场景进行技术预研和落地。

任职要求

计算机、人工智能、电子信息、自动化等相关专业,硕士及以上学历。 具备扎实的深度学习和计算机视觉基础,熟悉 Transformer、ViT、LLM/VLM 等主流模型架构。 熟悉 VLM/多模态模型训练与微调方法,有 SFT、RLHF、DPO、GRPO 等实际经验者优先。 对视觉理解、图像/视频理解、空间关系、场景理解等方向有较深入研究,具备较强的问题抽象和算法设计能力。 熟悉 PyTorch,具备大模型训练、推理及工程优化能力,有多卡训练经验。 有 Agent、Tool Calling、Function Calling、Reasoning、Memory、Planning 等相关研发经验者优先。 有端侧大模型、手机影像、Camera、ISP、NPU/AI Engine 等实际落地经验者优先。 有较强的论文阅读和技术创新能力,能够快速跟进并复现前沿工作。 加分项 有优秀的 VLM / MLLM / Agent 相关论文、开源项目或竞赛成果; 有 Qwen-VL、InternVL、LLaVA、Gemini、GPT-4o 等多模态模型训练或应用经验; 有图像/视频理解 Benchmark 构建及模型评测经验; 有 AI 摄影、智能相机、视觉 Agent、机器人视觉等项目经验; 有从 数据 → 训练 → 评测 → 部署 → 产品完整闭环经验。 立即投递