职位描述参与智元具身智能AI云平台核心服务建设,负责认证鉴权、SSO、多租户、配额管理、GPU资源管理、训练任务及高性能存储等后端系统的设计与开发,为机器人模型研发和规模化训练提供稳定、安全、高效的平台能力。 主要职责: 1. 负责云平台后端服务的架构设计、功能开发、接口设计及系统集成。 2. 负责用户、组织、租户、项目及角色权限体系建设,实现RBAC等权限模型。 3. 负责OAuth 2.0、OIDC、SAML、LDAP/AD等认证及SSO能力的开发与集成。 4. 负责GPU、CPU、内存及存储等资源的配额申请、分配、校验、回收和审计。 5. 参与GPU开发机、训练集群、训练任务、实验管理及高性能文件系统相关服务建设。 6. 对接Kubernetes、GPU资源池、调度系统、存储系统及监控告警平台。 7. 保障接口的幂等性、一致性、并发安全、可观测性及故障恢复能力。 8. 编写单元测试和接口测试,参与代码评审、性能优化及线上问题处理。 9. 与产品、前端、测试及基础设施团队协作,推动需求按计划交付。任职要求1. 本科及以上学历,计算机、软件工程等相关专业优先。 2. 3年以上Java后端开发经验及系统架构能力。 3. 熟练掌握Java及Spring Boot,了解Spring Cloud等微服务技术体系。 4. 熟悉MySQL、Redis、消息队列及分布式系统常见设计模式。 5. 熟悉RESTful API设计,具备接口安全、权限控制和审计意识。 6. 了解OAuth 2.0、OIDC、JWT、RBAC、SSO等认证鉴权机制。 7. 具备良好的系统设计、问题定位和跨团队协作能力。 8. 能够独立承担模块设计、开发、测试及上线交付。 加分项: 1. 有云平台、IAM、开发者平台或AI训练平台研发经验。 2. 熟悉Kubernetes、Docker、GPU调度、Slurm或分布式训练。 3. 有多租户、配额、计量计费、审批流或资源编排系统经验。 4. 熟悉Ceph、Lustre、NAS、对象存储等存储技术。 5. 有高并发、高可用和大规模分布式系统建设经验。