Ivyea Jobs 14414 roles · 231 companies · 刚刚
面壁智能 · 大模型

评测工程师 - 智能体方向

北京 社招 · 全职 Agent / 应用算法 工程开发

职位描述

1. 评测体系搭建:从0到1搭建覆盖基础模型与应用模型的评测体系,包含评测集构建、评估流程设计、评估指标定义等,推动评测方法论持续迭代,弥补目前在商业化评测、人评/体感评测、黑盒评测等维度的空白; 2. 自动化平台建设:设计并落地端到端的评测自动化Pipeline,提升评测效率和覆盖度,避免人力高成本、低效率的模式; 3. 开源Benchmark集成与自研:完善开源benchmark的集成工作,同时针对公司模型特点建设自研评测集,确保评测能有效暴露模型问题并引导迭代方向; 4. 评测结论驱动模型优化:建立评测到模型迭代的闭环机制,确保评测不只是“打分”,而是转化为可落地的模型优化建议,推动模型能力提升; 5. 团队建设与管理:组建并管理评测团队(目标10人左右),涵盖开源评测、商业化评测、人评/体感评测、黑盒评测等模块; 6. 跨部门协同:与文本、多模态+具身、语音、平台等协作,评测结论能有效赋能各项目组; 7. 中立裁判角色:以客观、权威的视角进行红蓝对抗式评测,不怕Say No,避免“内部一片peace”但模型实际能力不够。

任职要求

硬性要求 - 技术出身:有模型训练或算法背景,对模型有深度认知,理解评测方式如何引导模型迭代; - 大模型评测经验:有基础模型评测体系搭建经验,熟悉LLM/多模态/语音等模型评测维度和方法论; - 系统化能力:能够从0到1搭建评测体系,完成从idea到方案到执行的全流程; - 自动化平台建设能力:有评测自动化平台建设经验,能够将人工评测流程抽象为可复用的平台能力。 软性要求 - Aggressive且有判断力:敢于以红蓝对抗心态审视模型,不因内部压力而妥协评测标准,不怕得罪人; - 沟通协调能力强:在保持中立权威的同时,能够与各模型团队良性协作,不造成内耗; - 管理能力:有团队管理经验,能有效分配任务、培养团队。 加分项 - 有从0到1搭建评测团队的经历 - 了解多模态评测、Agent评测、RAG评测等前沿方向 - 有模型发版评审、安全合规评测经验
面壁智能去官方页面投递 →