职位描述
岗位职责
多模态训练数据处理 Pipeline 开发
基于 Spark、Ray、Hive 等分布式计算框架,开发和优化海量图文数据处理 Pipeline
参与多模态训练数据的采集、解析、清洗、去重、过滤、标注等核心环节建设
持续优化数据链路性能、稳定性及资源利用效率
多模态数据基础设施建设
参与训练数据存储、索引、检索等基础能力建设
参与数据集管理、数据版本管理及数据治理相关系统开发
推动训练数据生产流程标准化与自动化
数据质量评估与可观测性建设
构建数据质量、覆盖率、分布等评估体系
开发数据分析与可观测性工具,提升数据链路透明度
大模型数据技术调研与落地
调研 LLM/VLM 领域前沿数据工程与数据构建方案,并在工作中落地任职要求
教育背景:本科及以上学历,计算机相关专业优先
技术能力:熟练掌握 Python语言,Linux开发环境,分布式存储与计算原理
数据pipeline经验:Spark/Ray/Hive 等任意分布式计算引擎使用经验,数据pipeline搭建经验
工程能力:具备较强的问题分析与解决能力,快速学习并独立推进技术项目
团队协作:良好的沟通能力和团队合作精神
学习能力:快速学习新知识、新技能,有技术热情,自驱力强
实习时间:每周到岗 ≥ 4 天&连续实习 ≥ 3 个月,实习 6 个月以上优先
工作地点
北京市海淀区苏州街大恒科技大厦(线下办公)
允许3个月内投递4个职位,请选择适合的职位进行投递
立即投递