职位描述
职位描述
参与 GLM 机器学习平台开发,构建面向大模型训练、评测与强化学习(RL)的下一代 Agent 基础设施。
随着大模型能力从静态文本生成走向工具调用、环境交互、多步推理和自主任务执行,Agent Infra 已经成为模型研发中的关键环节。尤其在 RL 场景中,稳定、高效、可扩展的 Agent Infra 能够显著提升数据采集、环境交互、奖励评估、任务编排与训练反馈的效率,是推动模型能力持续迭代的重要基础。
在这里,你将参与搭建服务于前沿大模型研发的基础设施,与算法、训练、数据和平台团队紧密合作,支撑大规模 Agent 训练、评测和迭代流程。你也将有机会近距离了解前沿模型的研发进展,参与将最新的模型能力转化为可规模化训练与验证系统的过程。任职要求
具备良好的编程能力和工程素养,能够独立设计并实现高质量、可维护的系统模块。
至少熟练掌握以下语言之一:Golang / Rust / TypeScript
熟悉后端服务开发,理解并发编程、网络通信、RPC、任务调度、数据一致性、故障恢复等基础概念。
具备良好的系统设计能力,能够在性能、稳定性、可扩展性和开发效率之间做出合理权衡。
熟悉 Linux 开发环境,具备基本的问题定位、性能分析和线上排障能力。
对大模型、Agent、强化学习或 AI 基础设施方向有兴趣,愿意深入理解模型研发流程并参与关键基础设施建设。
具备良好的沟通协作能力,能够与算法、训练、平台等多团队高效合作。
加分项
有 Kubernetes 使用、开发或运维经验,熟悉 Pod、Deployment、Job、CRD、Operator、调度、存储、网络等相关机制者优先。
有大规模分布式系统、任务调度系统、训练平台、推理平台或数据平台建设经验。
熟悉 Ray、Slurm等任务编排或分布式计算框架。
有云原生、容器化、服务治理、可观测性、弹性伸缩、高可用架构相关经验。
熟悉模型训练或推理流程,理解 GPU 资源管理、训练任务调度、分布式训练基础概念。
熟悉 OCI 镜像仓库开发和优化。
立即投递