职位描述
1、负责评测体系的搭建与持续迭代,构建评测集、自动化评测流水线、指标计算与失败案例分析闭环,设计业务指标与可验证奖励信号,确保模型与 Agent 进化方向可量化、可追溯。
2、负责 ML/LLM 等模型的通专融合训练与持续进化,参与预训练、微调、对齐与持续学习等关键环节,探索通用能力与专业能力协同提升的训练范式,持续优化模型在专业任务上的性能与泛化。
3、负责 Meta-Agent 与进化策略设计,编排"提出假设-执行-评估-改进"的总闭环,驱动多 Agent 协同与自动化迭代,让整个生产线具备自进化能力。
4、负责底层基础设施的能力建设,包括 Agent Runtime、训练/推理调度、实验管理与可观测体系等,保障高并发训练、评测、推理任务在隔离、可复现的环境下稳定、高效运行。
5、与算法、产品、平台团队紧密协作,把评测、训练、Agent 任务执行、数据闭环等需求抽象为通用的平台能力与服务。任职要求
1、编程能力:精通 Python / Go / Java 中至少一门语言,具备大规模系统开发经验,Go 或 Python 经验优先。
2、工程经验:3 年以上后端、系统或算法工程经验,有复杂系统架构设计经验者优先;有分布式训练/推理、Agent 沙箱、评测框架、模型服务平台等任一方向经验更佳。
3、机器学习基础:深入理解 LLM / ML 原理与训练范式,熟悉主流大模型(GPT / Claude / 国产大模型等)的能力特性与使用边界。
4、评测与数据敏感度:能围绕业务目标设计评估体系,理解 Reward 信号、可验证奖励、数据闭环的设计原则,具备良好的实验分析与问题排查能力。
5、系统能力:理解 Linux 系统基础与容器化技术,熟悉 Kubernetes 基础资源与运行机制,对训练-推理-评测全链路的资源调度、状态管理与可观测体系有工程化落地经验。
加分项:
1、有 RLHF / RLAIF、Agent 评测、Meta-Agent、AutoML、模型自进化等任一方向的实际落地经验。
2、熟悉 DeepSpeed / Megatron / vLLM / TGI 等训练或推理框架,或熟悉Firecracker / gVisor / Kata Containers 等隔离技术中的一种或多种。
3、有知名开源项目贡献经历,或在顶会 /顶刊发表过相关方向论文。