Ivyea Jobs 9547 roles · 147 companies · 刚刚
VAST · AI 应用

SRE工程师

北京 社招 · 外包 AI Infra / 训练系统

职位描述

Vast 是一家专注于 3D AI 的独角兽公司,致力于构建能够理解和生成 3D 世界的基础模型。公司获得 NVIDIA、Lux Capital 等顶级机构投资,产品覆盖 3D 内容生成、机器人仿真训练、空间计算等前沿领域。SRE 团队是支撑这一切稳定运转的基础——你将直接参与构建服务于大规模 3D AI 模型训练与推理的基础设施体系。 职位要求 1、设计并维护 AWS / 阿里云的多账号体系(Organization / Landing Zone),规划账号结构与边界,制定并落地 IAM 权限策略,推行最小权限原则,管理角色、策略与 SCP 2、建立云资源全生命周期管理规范,包括 Tagging 标准、资源审计与清理流程,推动 FinOps 实践:成本归因、预算告警、RI / SP 购买策略、Spot 实例优化 3、通过 IaC 工具(Terraform 等)实现权限与资源的代码化管理,设计并维护混合云网络架构:VPC 规划、跨区域 / 跨云互联、VPN / 专线配置 4、负责 EKS / ACK 等托管 Kubernetes 集群的搭建、升级与日常运维,管理计算(EC2 / ECS)与存储(S3 / OSS / EBS / NAS)资源的选型、配置与调优,承接 AI 训练与推理工作负载的基础设施交付,保障服务稳定运行 5、处理复杂故障排查:网络不通、性能劣化、服务中断等场景的系统性定位与修复,设计并开发内部 CMDB 系统:资源数据建模、关系拓扑管理、自动发现与同步 6、搭建和维护 CI/CD 流水线,覆盖从代码提交到生产部署的完整交付流程,基于 ArgoCD / GitOps 实现声明式持续部署,管理多环境(dev / staging / prod)交付 7、开发自动化运维工具,提升团队工程效率,维护 Git 工作流规范,推动代码审查与分支管理最佳实践 8、构建并维护公司级可观测性体系,覆盖 Metrics、Logs、Traces 三大支柱,设计监控采集架构,管理 Prometheus / VictoriaMetrics 指标链路 9、搭建日志采集与存储链路(Fluent Bit → Loki / Elasticsearch),落地分布式追踪方案(OpenTelemetry / Jaeger),支持服务间链路分析 10、制定告警策略:分级告警、降噪规则、On-Call 流程与 Runbook 编写,覆盖网络、节点、容器、应用层的全栈监控,参与故障快速定位与复盘

任职要求

职位要求 1、精通 IAM 权限模型,具备多账号规划与落地经验,熟悉云资源生命周期管理,能制定 Tagging 规范和资源审计流程,有 FinOps 实践经验:成本归因、预算告警、RI/SP 采购、Spot 实例管理 2、了解 Terraform / CloudFormation,能通过代码管理权限与资源,有良好的安全意识,理解合规要求与云安全基线并且精通云网络架构:VPC 设计、跨区域互联、安全组与 ACL 策略 3、有 EKS / ACK 等托管 Kubernetes 集群的搭建与运维经验,熟悉计算和存储服务的选型与调优,具备系统性问题排查能力,掌握常用工具(tcpdump、strace、perf 等) 4、熟练使用 Linux,具备扎实的网络基础知识,有 CMDB 系统设计或开发经验,理解资源建模、关系拓扑等核心概念 5、熟练使用 Jenkins / GitLab CI / GitHub Actions 搭建 CI/CD 流水线,熟悉 ArgoCD / Flux 等 GitOps 工具,能实现声明式持续部署 6、掌握至少一门后端语言(Go / Python / Java),有 API 设计与开发经验,熟悉 Git 工作流、分支策略及代码审查流程 7、精通 Prometheus / VictoriaMetrics / Thanos 指标采集与存储方案,熟悉日志采集链路:Fluentd / Fluent Bit / Vector → Elasticsearch / Loki 8、有分布式追踪(Jaeger / Tempo / OpenTelemetry)落地经验,具备告警体系设计能力:分级、降噪、On-Call 流程、Runbook 编写 9、熟悉云网络与基础设施监控,能设计全栈监控方案 加分项 1、同时具备 AWS 和阿里云的实操经验,有 SCP / Permission Boundary 等高级权限控制经验,使用过 CUR / Cost Explorer / 阿里云费用中心做深度成本分析 2、了解 GPU 实例的采购与调度策略,有 OPS AI Agent 建设经验,善于利用 AI 工具提效,熟悉 MCP、Skill 等协议加分 3、有 GPU 集群(A100 / H100)运维经验,了解 RDMA / InfiniBand 网络,熟悉大规模分布式存储或高性能文件系统 4、有混合云 / 多云网络互联的实际落地经验,持有 AWS SAA / SAP 或阿里云 ACP 认证 5、有 OPS AI Agent 建设经验,善于利用 AI 工具提效,熟悉 MCP、Skill 等协议加分,有自研运维平台或内部开发者门户(IDP)的经验 6、熟悉云资源 API,能实现资源自动同步与状态管理,了解 Backstage / Port 等平台工程工具,有 Kubernetes Operator 开发经验 7、有 OPS AI Agent 建设经验,善于利用 AI 工具提效,熟悉 MCP、Skill 等协议加分,有 GPU 监控经验(DCGM Exporter、GPU 利用率与显存监控) 8、熟悉 Grafana,能构建复杂 Dashboard 与可视化方案,有 AIOps / 智能告警降噪相关经验,了解 SLI / SLO 体系并有实际落地经验
VAST去官方页面投递 →