职位描述
【岗位职责】
1. 参与大模型预训练数据建设,围绕图文合训、多模态理解及视觉能力训练,探索高质量数据构建和规模化扩展方案。
2. 负责图文及视觉数据的分析、清洗、去重、筛选和结构化处理,提升训练数据的质量与有效性。
3. 探索数据 Scaling、数据合成及配比策略,分析不同数据规模、质量和分布对模型效果的影响。
4. 建立数据质量评估体系,结合训练及评测结果定位数据问题,推动样本补充、配比调整与数据优化。
5. 与多方团队协作,推动“数据构建—模型训练—效果评测—数据迭代”闭环落地。
【任职要求】
1. 硕士及以上学历,计算机、人工智能、机器学习、数据科学、数学等相关专业优先。
2. 具备大模型或多模态模型预训练数据建设经验,参与过训练数据的清洗、筛选、配比、合成或质量评估。
3. 熟悉多模态模型、视觉模型、图文理解及图文对齐等技术,有图文合训经验者优先。
4. 对数据 Scaling 有一定理解,能够分析数据规模、质量、分布及配比对模型效果的影响;有相关实验经验者优先。
5. 具备良好的Python和数据处理能力,能够结合论文、开源方案及训练需求,推动数据方案落地。
6. 具备良好的问题拆解和协作能力,能够根据训练及评测结果发现问题并持续优化数据策略。
【岗位亮点】
1. 加入基座模型团队,深度参与多模态大模型预训练数据建设及模型训练链路,直接探索数据规模、质量与配比对模型能力的影响。
2. 岗位并非传统的数据清洗或标注管理,而是围绕Data Scaling、数据配比、数据合成和质量评估,研究如何规模化建设真正有效的训练数据。
3. 与模型算法团队深度协作,参与从训练目标、数据方案、Scaling实验到模型效果分析的全过程,推动模型能力持续提升。
4. 沉淀预训练数据建设与数据 Scaling经验,为后续向数据算法、模型训练及大模型研究方向发展提供成长空间。
立即投递