职位描述
岗位职责
设计和优化大规模 Web 爬虫的 URL 发现与调度系统,持续扩大数据覆盖面
建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率
主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率
建立数据质量评估闭环,从域名到页面的多层级质量管控
优化大规模数据处理管线的性能和稳定性
希望你具备以下经验
大规模搜索引擎或 Web 爬虫系统实战经验,做过百亿级以上 URL 池的全链路
深入理解全网 URL 发现的多种手段
熟悉主流反爬机制及对抗方案
扎实的分布式数据处理能力(Spark / Flink 等)
强烈加分
有大模型预训练语料采集和清洗经验
允许6个月内投递3个职位,请选择适合的职位进行投递
立即投递