职位描述
1、参与大模型训练数据的构建,不限于数据过滤,质量评估,数据增强等,搭建高效的分布式数据pipeline;
2、参与模型训练数据标签体系的建设,打造数据自动打标环路,完成海量数据打标和知识库构建;
3、参与模型数据质量的建设,面向网页,书籍,代码等不同类型数据,打造通用的质量评估策略。任职要求
1、计算机相关专业,本科及以上在读;
2、精通Python语言,熟悉Spark、Ray等分布式框架,具备丰富的大规模数据处理实践经验是加分项;
3、具备良好的逻辑能力,细心严谨,对数据敏感;
4、具备自主调研能力,以下方向有实践经验或兴趣浓厚优先:大规模文本数据质量提升、文本数据处理。