职位描述负责智元具身智能AI云平台的可靠性与可观测建设,覆盖控制面、计算、存储、网络及训练服务。可按可靠性工程或可观测研发方向应聘,任职要求中的方向项满足其一即可,入职后按专长分工。 主要职责 1. 建设统一指标、日志和链路追踪能力,规范服务及资源标识,关联控制面、算力、存储与训练任务信息,支持跨组件排障。 2. 与服务负责人制定SLI、SLO和告警规则,建设告警分级、聚合、抑制与路由机制,持续改进告警有效性和响应效率。 3. 建设CI/CD、GitOps及配置管理流程,完善变更检查、灰度发布与回滚能力,协同服务团队验证发布和恢复方案。 4. 按团队安排参与值班与应急响应,组织协同排障和故障复盘,维护操作手册及恢复预案,跟进根因修复和改进措施。 5. 建设容量、资源利用率及成本可视化能力,识别容量风险和资源浪费,联合计算、存储等团队推动扩容与使用效率优化。 6. 开发巡检、部署验收和故障诊断工具,联合服务负责人开展故障切换及恢复演练,推动重复操作自动化和可靠性问题闭环。 承担主要目标/关键任务 1. 建设统一指标、日志和链路追踪能力,规范服务及资源标识,关联控制面、算力、存储与训练任务信息,支持跨组件排障。 2. 与服务负责人制定SLI、SLO和告警规则,建设告警分级、聚合、抑制与路由机制,持续改进告警有效性和响应效率。 3. 建设CI/CD、GitOps及配置管理流程,完善变更检查、灰度发布与回滚能力,协同服务团队验证发布和恢复方案。 4. 按团队安排参与值班与应急响应,组织协同排障和故障复盘,维护操作手册及恢复预案,跟进根因修复和改进措施。 5. 建设容量、资源利用率及成本可视化能力,识别容量风险和资源浪费,联合计算、存储等团队推动扩容与使用效率优化。 6. 开发巡检、部署验收和故障诊断工具,联合服务负责人开展故障切换及恢复演练,推动重复操作自动化和可靠性问题闭环。任职要求任职要求 1. 教育背景:本科及以上学历,计算机、软件工程、网络工程、信息技术等相关专业优先。 2. 工作经验:3年以上SRE、云平台运维或可观测研发经验,具备生产故障处理或平台建设经历;具有5年以上相关经验及可靠性体系建设经验者优先。 3. 熟悉Linux、容器和Kubernetes,能够结合系统指标、日志及网络信息分析常见故障,具备生产问题定位能力。 4. 掌握Python、Go或Shell至少一种语言,能够开发可维护的自动化工具,具备代码管理、测试和技术文档编写习惯。 5. 可靠性方向:熟悉发布、升级和回滚流程,理解SLI、SLO、容量规划及故障复盘,能够推进生产变更与协同排障。 6. 可观测方向:熟悉Prometheus、Grafana或同类工具,具备监控或日志平台建设经验,理解链路追踪与告警治理。 加分项 1. 有GPU集群、训练平台、分布式存储或高性能网络的可靠性保障经验,能定位跨组件故障。 2. 有OpenTelemetry或同类工具实践,具备告警降噪、故障演练或自动化诊断项目经验。