OLAP 研发工程师(模型数据挖掘方向)
北京
社招 · 全职
30000 - 60000 K/月 / 软件类
工程开发
职位描述
工作职责
面向AI 模型数据挖掘、样本筛选、特征探查场景,搭建数据挖掘服务平台,负责平台设计、功能迭代与落地,支撑模型训练前的数据探查、样本过滤、特征统计、离线分析等核心业务。
支撑 PB 级模型样本数据集,实现高并发特征查询、多维样本筛选、批量特征导出、样本统计分析,持续优化查询时延与吞吐,保障模型迭代的数据交付效率。
构建湖仓一体数据链路,打通上游样本数据接入、实时 / 离线计算、模型训练数据输出全流程,实现批流统一的样本数据管理。
深度开展内核调优、源码优化、生态组件开发;针对模型挖掘场景的大扫描、多维度过滤、高并发特征探查负载,优化查询优化器、存储层、缓存策略、分区调度,降低算力与存储成本。
协同算法、AI 训练团队,挖掘模型迭代过程中的各类数据痛点;参与数据中台、特征查询平台建设,跟进 OLAP 前沿技术调研,沉淀 AI 场景下大规模数据挖掘最佳实践。任职要求
本科及以上学历,3~5 年分布式大数据、OLAP 引擎研发经验,有 AI 样本 / 特征数据平台建设经验优先。
深入掌握 Apache Doris,有源码调优、二次开发经验;熟悉 StarRocks/ClickHouse/Trino/Iceberg 等湖仓相关技术优先。
扎实计算机基础,精通数据结构、分布式系统理论;熟练掌握 Java/go/C++,具备分布式系统性能 Profiling、故障诊断、线上调优能力。
熟悉湖仓一体架构,了解 Iceberg、Spark、Flink、对象存储、分布式文件系统;有大规模样本数据集管理、特征挖掘、数据探查相关落地经验加分。
具备平台化架构设计思路,能够通过工具化、组件化方式解决业务问题;良好沟通协作能力,可和算法团队对齐模型数据挖掘需求,主动推动技术方案落地。
立即投递