职位描述职位概述 负责智元具身智能MLOps平台研发,建设训练任务、实验管理、流水线及模型注册能力,支持数据挂载、Checkpoint管理与故障恢复,为算法团队提供可追踪、可复现的模型研发环境。 主要职责 1. 建设训练任务管理能力,支持环境配置、提交、状态查询、日志查看、重试与终止,对接计算团队提供的资源队列和调度服务。 2. 接入PyTorch及分布式训练框架,提供单机多卡、多机多卡训练模板和启动机制,沉淀环境验证与常见故障诊断能力。 3. 建设MLflow类实验管理能力,记录代码版本、运行环境、参数、指标和训练产物,支持实验查询、对比与结果追溯。 4. 对接数据与存储服务,管理数据版本关联和挂载配置,与算法团队约定Checkpoint接口,完善保留策略与任务恢复流程。 5. 建设训练Pipeline和模型注册能力,接入算法团队的训练与评估程序,编排数据准备、训练、评估和产物登记流程。 6. 协同算法与基础设施团队定位任务启动、通信、数据读取及恢复异常,完善平台API、自动化测试、使用文档和训练基准。 承担主要目标/关键任务 1. 建设训练任务管理能力,支持环境配置、提交、状态查询、日志查看、重试与终止,对接计算团队提供的资源队列和调度服务。 2. 接入PyTorch及分布式训练框架,提供单机多卡、多机多卡训练模板和启动机制,沉淀环境验证与常见故障诊断能力。 3. 建设MLflow类实验管理能力,记录代码版本、运行环境、参数、指标和训练产物,支持实验查询、对比与结果追溯。 4. 对接数据与存储服务,管理数据版本关联和挂载配置,与算法团队约定Checkpoint接口,完善保留策略与任务恢复流程。 5. 建设训练Pipeline和模型注册能力,接入算法团队的训练与评估程序,编排数据准备、训练、评估和产物登记流程。 6. 协同算法与基础设施团队定位任务启动、通信、数据读取及恢复异常,完善平台API、自动化测试、使用文档和训练基准。任职要求任职要求 1. 教育背景:本科及以上学历,计算机、人工智能、软件工程、自动化、机器人等相关专业优先。 2. 工作经验:3年以上机器学习平台、训练基础设施或后端研发经验,参与过训练平台或分布式训练工程交付;具有5年以上相关经验及核心模块设计经验者优先。 3. 熟练掌握Python,具备服务端开发、API设计及数据存储基础,能够独立完成平台模块开发、测试和问题定位。 4. 熟悉Linux、容器和Kubernetes作业机制,理解训练任务与资源队列的关系,能够对接底层调度和存储服务。 5. 熟悉PyTorch训练流程,了解分布式训练启动、数据加载、模型保存和恢复,能够分析常见训练环境与运行问题。 6. 在任务编排、实验追踪、Checkpoint或模型版本管理中至少一个领域有实践,能将算法研发流程转化为平台功能。 加分项 1. 有MLflow、Kubeflow或同类平台二次开发经验,熟悉训练流水线和模型产物管理。 2. 有具身智能、多模态或强化学习训练工程实践,或具备主流分布式训练框架接入与排障经验。