职位描述您将深度参与下一代多模态大模型 (语言-视觉-动作) 的数据真值构建与评测工作,跟踪前沿多模态大模型进展,理解模型能力边界(理解、推理、空间/时间定位等),为具身基座模型训练提供高质量数据。 具体涉及以下任一或多项内容: 1. 多模态数据(文本、视觉、动作等)清洗、标注和格式化。构建高效的数据处理流程,支持模型训练与推理。 2. 构建分布合理的视频理解数据 (人类行为、事件识别) 和高质量 Video Caption/Temporal Grounding;构造CoT真值,进行长程行为/任务拆解,提供逻辑清晰的中间推理步骤。 3. 系统性地评估数据的集中、离散程度和形状特征,使用高维数据降维技术 (PCA, t-SNE等) 可视化和量化潜在的流形结构和数据的内在维度。任职要求1、了解多模态大模型范式,熟悉多模态数据的清洗/标注/统计方式,对数据在训练中的作用和大模型能力边界有深刻理解。 2、能够设计pipeline和优化prompt,熟悉分布式数据处理,提升数据生产的质量和效率。 3、熟悉数据处理工具(如Pandas、NumPy等)并完成完整数据处理流程;熟悉Python编程,了解Linux环境和常见开发工具。 4、对数据质量和多样性有高标准,细致负责,发现并解决数据问题。 加分项: 1、有实际多模态大模型训练经验。 2、有该方向相关会议文章发表的优先。