Ivyea Jobs 8169 roles · 112 companies · 刚刚
衔远科技 · 大模型

大数据开发工程师

北京 社招 · 全职 工程开发

职位描述

1、参与百万级网页数据清洗Pipeline的核心开发工作,负责大规模网页数据的结构化抽取、领域分类、质量评估与去重优化。 2、负责模型驱动的数据清洗策略设计与实现,通过机器学习模型进行内容质量打分、领域分类、语义去重等智能化数据处理。 3、参与构建数据-模型反馈闭环系统,通过模型效果评估反向优化数据清洗策略,持续提升数据质量与模型性能。 4、深度参与大模型训练数据链路建设,包括高质量数据生成、多模态数据预处理等关键环节,为大模型提供优质训练语料。

任职要求

1、扎实的Python编程基础,熟练掌握pandas、numpy等数据科学工具栈。 2、具备分布式计算基础,了解Spark、Hadoop、Flink等大数据处理框架至少一种。 3、具备良好的SQL能力,熟悉Hive、ClickHouse等数据仓库技术。 4、熟悉数据仓库理论方法及ETL相关技术,对于数据的架构和设计有一定的思考,具备良好的建模思维。 5、优秀的学习能力和问题解决能力,具备工程化思维和数据敏感性。 加分项 1、具备大模型数据链路(清洗、分类、打分、去重、样本生成、cc数据集处理等)业务背景。 2、有大模型(LLM)相关项目经验,了解模型训练数据处理流程。
衔远科技去官方页面投递 →