职位描述
岗位定位
负责公司多云平台、云原生及大模型基础设施的日常运营与治理,聚焦资源管理、成本优化、权限安全、故障运维及运维自动化,保障基础设施稳定、安全、高效运行。
岗位职责
1. 多云资源管理:负责主流公有云平台资源日常运维,统筹服务器、容器、存储、GPU、网络等核心资源;落实资源标准化治理,全生命周期管理资源变更、扩缩容与下线,清理闲置低效资源,支撑业务资源规划。
2. 云成本管控:负责多云账单核对、统计与分析,搭建多维度成本分摊体系;识别异常消费与资源浪费,落地各类降本优化方案,输出成本分析报告,对接财务与业务完成账单对账。
3. 账号权限安全治理:负责多云账号、密钥及权限体系管理,依据最小权限原则完成权限管控与账号生命周期管理;定期开展权限安全审计,落地SSO、MFA等安全机制,保障云平台访问安全合规。
4. 大模型平台运维:负责主流大模型服务、API密钥及调用额度管控;维护统一模型网关,配置限流、路由等策略;监控模型调用成本与运行状态,排查各类调用故障,支撑业务模型接入使用。
5. 云原生与系统运维:负责Linux系统、Docker、K8s集群日常运维与故障排查;保障云网络、存储、容器等基础设施稳定,承接变更、备份、应急恢复工作,完善运维台账与文档。
6. 监控与运维自动化:搭建云资源、容器及大模型服务监控告警体系;通过脚本、云API及IaC工具实现运维工作自动化,持续优化运维流程,提升运维效率。任职要求
1. 本科及以上学历,计算机相关专业优先,1年以上云运维、DevOps、SRE相关经验。
2. 精通Linux系统,具备扎实的系统、网络故障排查能力;掌握Docker、K8s云原生技术,具备云成本优化实战经验。
3. 熟练掌握至少两款主流公有云,熟悉云产品及权限管控体系;了解主流大模型调用机制,熟悉Token、限流、配额等核心概念。
4. 会使用AI开发工具,熟悉自动化运维工具优先。
5. 具备良好的沟通推进能力与责任心,工作严谨细致。
6.以下为加分项:
具备大规模多云资源、成本治理及企业级权限、密钥安全治理经验;熟悉GPU、AI推理平台及LiteLLM等模型组件、多模型统一接入;熟练掌握Terraform等自动化工具;有CMP、AI网关等平台建设经验,持有主流云、K8s认证优先。