职位描述
岗位职责
1. 核心主责:PostgreSQL 全链路运维与疑难故障兜底负责线上 PostgreSQL 数据库日常运维、应急故障处置、内核级问题定位;针对慢 SQL、锁竞争、事务异常、索引失效、连接暴涨、存储膨胀、主从同步延迟、数据一致性异常等问题快速根因排查、落地优化方案,保障核心业务数据库稳定运行;主导 PG 高可用架构、备份恢复、容灾方案设计与落地。
2. 负责数据库整体架构设计、数据模型评审,包含表结构、索引、分区、冷热分层、数据生命周期、分库分表方案设计,把控上线变更质量。
3. 搭建并落地数据库全流程规范体系:SQL Review 审核机制、建模规范、DDL 变更管控、监控告警体系、容量规划、资源调度与存储成本治理。
4. 负责 Redis、MongoDB 等 NoSQL 存储架构运维、性能调优与稳定性治理,解决缓存穿透、集群扩容、内存溢出、分片不均衡等线上问题。
5. 湖仓体系为辅助工作:参与阿里云湖仓体系(OSS、MaxCompute、Hologres、Paimon)链路维护、查询性能优化、数据倾斜治理,支撑离线 / 实时数据分析需求。
6. 深度参与数据平台、训练平台、标注质检、数据发版系统架构建设,在前期方案阶段介入,提前规避数据库性能、容量、扩展性风险。
7. 基于 Shell/Python 等开发自动化运维、巡检、监控、治理工具,提升数据库运维效率,沉淀可复用问题治理方案。任职要求
任职要求(PG 能力为硬性核心门槛)
1. 3 年及以上专职 DBA、数据库底层运维、数据基础设施相关工作经验,有大规模 PostgreSQL 线上深度运维实战经验优先。
2. 精通 PostgreSQL 内核原理:事务机制、MVCC、锁机制、WAL 日志、并行查询、复制同步、vacuum、参数调优,能独立深度解析执行计划、根治复杂慢查询。
3. 熟练 MySQL/Oracle 至少一款关系型数据库,具备多类型数据库迁移、异构适配经验。
4. 熟练 Redis、MongoDB 等至少一类 NoSQL 分布式存储架构、集群运维、故障排查与性能优化。
5. 具备专业数据建模能力,可根据业务访问模式设计合理索引、分区、冷热分层、分库分表方案。
6. 具备线上数据库应急排障实战能力,可快速处理宕机、数据损坏、同步中断、死锁、雪崩等突发线上事故。
7. 熟练 Linux 操作系统,可使用 Shell/Python 至少一门语言编写运维脚本、自动化工具,定位系统层资源瓶颈。
8. 熟悉数据湖、湖仓一体基础概念,具备基础大数据链路排障、查询优化能力即可。
加分项
1. 亿级大表长期治理经验,主导过数据库大规模性能重构、重大线上故障复盘整改专项。
2. 熟悉阿里云 MaxCompute、Hologres、Paimon、OSS、DataWorks 等云原生湖仓产品,有落地优化经验。
3. 掌握 Iceberg/Hudi/Delta Lake、Spark、Flink、ClickHouse、StarRocks 等大数据 / OLAP 组件使用与调优。
4. 自动驾驶、机器人行业数据平台、IoT 时序数据库、海量时序数据治理相关落地经验。
5. 搭建过数据血缘、数据质量、数据成本、数据生命周期自动化治理平台。
6. 具备 SRE 运维体系思维,从稳定性、可观测、容量、成本四个维度做长期数据库体系化治理。