职位描述1. 负责大数据平台的数据处理及算法开发,包括离线调度、实时流处理、算法开发; 2. 参与数据采集、清洗、建模、存储、分析及接口服务全流程; 3. 参与 Airflow 等调度工具的调度任务开发; 4. 负责基于 Flink/Spark等技术栈的实时流式数据处理开发,支持高并发、低延迟的业务场景; 5. 微服务接口开发任职要求基础能力: 1. 计算机相关专业本科及以上学历,1-2年以上大数据开发经验; 2. 熟练 Java/Scala 编程语言,具备良好的编码规范和逻辑思维能力; 3. 熟悉 Linux 系统环境,掌握 Shell/Python 脚本开发; 4. 熟练微服务接口开发,有多部门合作者优先; 5. 熟悉任意主流MPP数据库,处理过大规模复杂聚合分析查询及分析。 实时开发方向: 1. 熟悉Apache Flink,有丰富的实时流处理项目经验,熟悉状态管理、窗口机制、FlinkSQL 等; 2. 熟悉 Kafka/Mqtt 等消息中间件; 3. 熟悉主流大数据存储组件,尤其是列式存储; 4. 有 Flink on K8s 部署及调优经验者优先; 离线调度方向: 1. 熟悉 Hive、Spark、PostgreSQL(能够结合PostGIS插件,分析地理空间数据,并进行调优者优先); 2. 了解 数仓建模,熟悉维度建模、数据分层管理; 3. 熟练使用主流任务调度工具,如Airflow; 4. 有大规模数据批处理经验; 5. 具备任务依赖分析、失败重试、日志追踪、资源隔离等实践经验; 平台与生态: 1. 熟悉K8s及部署运维经验者优先; 2. 有开源社区贡献者优先; 加分项: 1. 对数据敏感,具备一定的数据分析和业务理解能力(加分项); 2. 有数据治理、数据血缘、数据质量监控等实践经验(加分项); 3. 有团队协作精神,沟通能力强,责任心强,自驱型工程师。 4. 学习能力强,问题解决能力强,抗压能力强。