职位描述
负责大模型训练数据 Pipeline 和数据生产基础设施建设,推动数据接入、清洗、质检、交付流程工程化、配置化和平台化。
岗位职责
1、负责大规模数据接入、解析、清洗、去重、采样及任务编排;
2、建设标准化、配置化 Data Pipeline,将高频处理能力沉淀为可复用算子和自助生产能力;
3、建设数据版本、血缘、任务状态、异常恢复及质量追踪能力;
4、联动数据、质检、标注和实验平台,推动自动质检、验收及数据效果反馈链路建设。任职要求
1、 Python 工程能力扎实,熟悉大规模数据处理;
2、熟悉 Spark / Ray 等至少一种分布式计算框架;
3、熟悉对象存储、Parquet / JSONL /LanceDB等数据格式及大规模 IO;
4、有大模型数据、数据平台、Workflow、数据质量相关经验优先。