Ivyea Jobs 5948 roles · 69 companies · 刚刚
爱诗科技 · AI 应用

可观测平台工程师

北京 社招 · 全职 AI Infra / 训练系统

职位描述

1.负责公司统一可观测平台(Metrics / Logs / Traces / Events)的整体架构设计与建设,支撑大规模 AI 训练与推理基础设施的稳定运行; 2.建设覆盖 Kubernetes、GPU 集群、网络、存储及业务服务的监控体系,提升系统可用性及故障发现效率; 3.设计并落地统一日志平台,包括日志结构化规范、日志采集链路、索引与查询优化及成本控制策略; 4.建设分布式链路追踪体系,提升复杂系统性能分析能力及问题定位效率; 5.设计统一告警与事件管理体系,提升异常检测能力并降低误报率; 6.持续优化监控、日志、链路追踪等系统的性能及存储成本,提升平台可扩展性与稳定性。

任职要求

1.计算机科学、软件工程或相关专业本科及以上学历,3 年及以上 SRE / 可观测平台 / 监控系统相关经验; 2.熟悉 Linux 操作系统原理及网络基础,对系统性能分析与故障排查有系统化方法论; 3.熟悉 Kubernetes 体系,理解容器调度、网络及资源管理机制; 4.熟悉主流可观测技术体系的设计原理,如 Metrics、Logging、Tracing 等数据模型及采集链路; 5.熟悉至少一种编程语言(Python / Go),具备工程开发能力,能够开发或扩展平台组件; 6.具备良好的系统设计能力,能够在复杂分布式系统中设计高可靠、高扩展的可观测方案; 7.具备良好的问题分析能力与责任意识,能够推动复杂问题的闭环解决。 加分项 1.有 GPU 集群监控或 AI infra 可观测经验; 2.有大规模 Kubernetes 集群运维或监控体系建设经验; 3.有统一可观测平台(Metrics / Logs / Traces)建设经验; 4.熟悉 OpenTelemetry 等可观测标准体系; 5.有高吞吐日志系统或时序数据库优化经验。