Ivyea Jobs 5948 roles · 69 companies · 刚刚
智元机器人 · 具身智能

数据多模态算法专家

上海 社招 · 全职 多模态 / 视觉 / 语音

职位描述

‌1、多模态数据引擎设计与开发‌:负责构建高吞吐、低延迟的多模态数据处理流水线,支持文本、图像、视频、音频等异构数据的统一接入、去重、过滤、增强与结构化存储,提升数据可用性与训练稳定性。 ‌2、基座模型预训练数据构建‌:基于业务场景需求,设计并实现高质量预训练数据集的构建方案,包括跨模态对齐策略、数据混合比例优化、噪声样本识别与剔除机制,确保数据分布合理、覆盖全面。 ‌3、自动化标注与数据合成技术研究‌:探索基于大模型(如LLM/VLM)的弱监督/自监督标注方法,研发合成数据生成技术(如Diffusion生成图文对、仿真环境生成带标签视频),降低对人工标注的依赖。 ‌4、数据-模型联合优化‌:分析模型训练过程中的数据敏感性,识别“高价值数据”与“有害样本”,推动数据策略动态调整;结合模型反馈构建数据优先级排序机制,实现“数据主动供给”。 5、‌多模态基座模型训练与评估‌:参与多模态大模型(如CLIP、Flamingo、LLaVA架构)的预训练与后训练过程,设计指令微调、偏好对齐等任务的数据构造方式,并建立客观、可复现的模型能力评测体系。 6、‌前沿技术探索与落地‌:跟踪NeurIPS、ICML、CVPR、ACL等顶会最新进展,探索数据引擎与世界模型、Agent系统、多模态RAG等方向的融合可能性,推动新技术在实际业务中的验证与应用。

任职要求

1、计算机科学、人工智能、机器学习或相关领域硕士及以上学历,具备扎实的算法理论基础与工程实现能力。 2、熟悉多模态大模型(VLM/MLLM)的技术架构与训练流程,掌握CLIP、BLIP、LLaVA、Qwen-VL等主流模型原理,有实际项目经验者优先。 3、精通Python编程语言,熟练使用PyTorch、HuggingFace Transformers等深度学习框架;具备大规模数据处理经验,熟悉Spark、Dask、Ray等分布式计算工具者更佳。 4、在多模态预训练、自监督学习、表征学习、跨模态对齐等方向有深入研究,熟悉对比学习、掩码学习、图文匹配、视频-文本检索等核心技术。 5、具备优秀的工程能力,能独立完成从数据清洗、特征提取到模型训练的端到端开发,熟悉Docker、Kubernetes、MLflow等MLOps工具者优先。 6、对数据质量与模型性能的关系有深刻理解,具备较强的分析与问题定位能力,能够通过数据诊断驱动模型优化。 7、具备良好的沟通协作能力,能与算法、工程、产品团队高效协同,推动复杂系统的落地与迭代。