Ivyea Jobs 6655 roles · 90 companies · 刚刚
星尘智能 · 具身智能

AI infra工程师

深圳 社招 · 全职 产品事业部 AI Infra / 训练系统

职位描述

【岗位职责】 1.负责 AI Infra平台所需的后端基础设施建设,保障任务能够稳定地提交、调度、执行、监控和归档。 2.建设任务执行平台能力,包括任务队列、Worker 系统、容器化执行环境、资源调度、运行状态同步、日志采集和失败恢复。 3.负责 CPU / GPU 算力资源管理,包括资源申请、任务排队、GPU 可用性检查、调度约束、资源隔离和使用统计。 4.负责容器化运行环境建设,包括镜像管理、环境预检、容器启动、挂载管理、运行时权限控制和问题排查。 5.负责数据、模型、代码等资源进入执行环境的工程链路,保障任务运行所需资源可被稳定、安全、可追踪地使用。 6.参与运行时平台的稳定性建设,包括任务状态机、失败重试、异常诊断、日志监控、产物归档和线上问题排查。 7.与算法、平台、产品团队协作,将底层基础设施封装成稳定、易用的后端服务。 8.能够使用 Coding Agent 提升开发效率,并负责对 Agent 生成的代码进行工程审查、方案拆解、测试验收和上线把关。 【任职要求】 1.本科及以上学历,计算机、软件工程、自动化等相关专业。 2.具备扎实的后端开发能力,熟悉 Python / Go / Java / Rust 任一语言,能独立负责核心后端模块。 3.熟悉 Linux、Docker、容器运行环境、服务部署、日志监控和常见线上问题排查。 4.有任务调度、异步任务队列、Worker 系统、分布式系统、云原生平台、机器学习平台或数据处理平台经验。 5.了解 CPU / GPU 资源管理,有 GPU 任务调度、模型训练/推理平台、算力平台经验者优先。 6.熟悉对象存储、文件挂载、镜像管理、运行产物管理、权限控制等工程问题者优先。 7.具备较强的问题排查和系统稳定性意识,能处理任务失败、资源占用、容器启动失败、环境不一致、服务性能瓶颈等问题。 8.动手能力强,能快速进入复杂项目,承担实际开发、交付和线上稳定性保障。 【加分项】 1.做过 AI Infra、MLOps、LLMOps、训练平台、推理平台、GPU 调度平台或代码执行平台。 2.熟悉 Ray、Kubernetes、Volcano、Slurm、Argo、Airflow、Temporal 等调度或编排系统。 3.做过 Agent Runtime、Tool Runtime、代码执行沙箱、长任务执行系统、多 Worker 调度系统。 允许3个月内投递3个职位,请选择适合的职位进行投递 立即投递
星尘智能去官方页面投递 →