职位描述
1、参与百万级网页数据清洗Pipeline的核心开发工作,负责大规模网页数据的结构化抽取、领域分类、质量评估与去重优化。
2、负责模型驱动的数据清洗策略设计与实现,通过机器学习模型进行内容质量打分、领域分类、语义去重等智能化数据处理。
3、参与构建数据-模型反馈闭环系统,通过模型效果评估反向优化数据清洗策略,持续提升数据质量与模型性能。
4、深度参与大模型训练数据链路建设,包括高质量数据生成、多模态数据预处理等关键环节,为大模型提供优质训练语料。任职要求
1、扎实的Python编程基础,熟练掌握pandas、numpy等数据科学工具栈。
2、具备分布式计算基础,了解Spark、Hadoop、Flink等大数据处理框架至少一种。
3、具备良好的SQL能力,熟悉Hive、ClickHouse等数据仓库技术。
4、熟悉数据仓库理论方法及ETL相关技术,对于数据的架构和设计有一定的思考,具备良好的建模思维。
5、优秀的学习能力和问题解决能力,具备工程化思维和数据敏感性。
加分项
1、具备大模型数据链路(清洗、分类、打分、去重、样本生成、cc数据集处理等)业务背景。
2、有大模型(LLM)相关项目经验,了解模型训练数据处理流程。