职位描述
政企 AI 的效果,往往从数据开始,也在数据里持续变好。你将负责把分散在文档、系统、业务流程和现场反馈中的数据,建设成可理解、可管理、可追溯、可用于训练和应用迭代的数据资产。你的工作会覆盖数据标准、数据目录、质量规则、文档解析、知识切分、标注体系、数据安全、权限管理、难例回流和持续学习闭环。你需要理解行业语义,也需要把治理规则落实到工具和流程中,让数据真正服务于模型训练、知识库问答、智能体运行和客户交付。
岗位职责
1. 负责政企行业数据治理体系建设,制定数据分类分级、元数据、数据目录、质量标准、生命周期和使用规范。
2. 面向政策法规、公文材料、科研文献、设备资料、SOP、工艺数据、业务记录和多模态数据,设计采集、清洗、解析、切分、标注和入库流程。
3. 建立适用于大模型训练、RAG、知识库和智能体的高质量数据集,管理数据来源、版本、授权、加工过程和结果追溯。
4. 设计数据质量规则和检查机制,关注完整性、准确性、一致性、时效性、重复率、可引用性和敏感信息处理。
5. 协同产品、算法、评测和交付团队完成数据需求分析、标注规范制定、样本验收、难例挖掘和数据闭环,推动一次性交付形成持续学习能力。
6. 参与数据脱敏、权限控制、审计留痕和私有化部署的数据方案设计,沉淀治理工具、操作手册、行业数据模板和质量报告。任职要求
1. 本科及以上学历,计算机、信息管理、数据科学、图书情报、统计学、工业工程等相关专业优先。
2. 有企业数据治理、主数据、知识管理、数据资产、数据质量或数据平台建设经验。
3. 理解文档数据、结构化数据、知识图谱、向量知识库、RAG 和大模型训练数据的基本特点。
4. 熟悉数据标准、数据目录、数据质量规则、数据血缘、权限管理和数据安全中的部分方法或工具。
5. 具备较强的抽象能力和执行力,能适应多行业、多项目并行的工作方式,把行业经验转化为清晰的数据规范、标注说明和可检查规则。
加分项
1. 有政务、军工、央国企、运营商、工业制造、能源、医疗、法律或科研数据项目经验。
2. 有大模型训练数据、指令数据、偏好数据、评测数据、知识库或智能体技能库建设经验。
3. 熟悉 OCR、版面分析、文档解析、数据标注平台、数据合成或多模态数据处理。
4. 有数据分层治理、数据安全合规、敏感数据脱敏或离线私有化环境经验。
5. 具备 Python、SQL、脚本自动化或数据分析能力,能够亲自搭建和验证数据处理流程。