职位描述
1.负责公司统一可观测平台(Metrics / Logs / Traces / Events)的整体架构设计与建设,支撑大规模 AI 训练与推理基础设施的稳定运行;
2.建设覆盖 Kubernetes、GPU 集群、网络、存储及业务服务的监控体系,提升系统可用性及故障发现效率;
3.设计并落地统一日志平台,包括日志结构化规范、日志采集链路、索引与查询优化及成本控制策略;
4.建设分布式链路追踪体系,提升复杂系统性能分析能力及问题定位效率;
5.设计统一告警与事件管理体系,提升异常检测能力并降低误报率;
6.持续优化监控、日志、链路追踪等系统的性能及存储成本,提升平台可扩展性与稳定性。任职要求
1.计算机科学、软件工程或相关专业本科及以上学历,3 年及以上 SRE / 可观测平台 / 监控系统相关经验;
2.熟悉 Linux 操作系统原理及网络基础,对系统性能分析与故障排查有系统化方法论;
3.熟悉 Kubernetes 体系,理解容器调度、网络及资源管理机制;
4.熟悉主流可观测技术体系的设计原理,如 Metrics、Logging、Tracing 等数据模型及采集链路;
5.熟悉至少一种编程语言(Python / Go),具备工程开发能力,能够开发或扩展平台组件;
6.具备良好的系统设计能力,能够在复杂分布式系统中设计高可靠、高扩展的可观测方案;
7.具备良好的问题分析能力与责任意识,能够推动复杂问题的闭环解决。
加分项
1.有 GPU 集群监控或 AI infra 可观测经验;
2.有大规模 Kubernetes 集群运维或监控体系建设经验;
3.有统一可观测平台(Metrics / Logs / Traces)建设经验;
4.熟悉 OpenTelemetry 等可观测标准体系;
5.有高吞吐日志系统或时序数据库优化经验。