职位描述
1.负责构建和迭代AI大模型(LLM)的自动化评测体系,包括但不限于医学合理性、安全性、有用性、忠实度、泛化性等维度的量化评估。
2. 设计与开发内部评测平台、工具链和评测数据集(Test Set),实现对模型能力的持续监控和回归测试。
3. 深入分析模型评测结果,定位模型缺陷和短板,为模型迭代优化(微调、Prompt工程、RAG增强)提供数据驱动的决策依据。
4. 与医学团队紧密合作,将抽象的医学标准和业务需求转化为可计算、可执行的评测指标和评测任务。
5. 跟踪学术界和工业界在LLM评测方面的最新进展(如MT-Bench, AlpacaEval等),并引入到实际工作中。任职要求
1. 学历与经验:硕士及以上学历,计算机、统计学、应用数学等相关专业,3年以上机器学习/算法相关工作经验。
2. 工程基础:熟练掌握Python及主流数据科学库(Pandas, NumPy, Sklearn);熟练掌握PyTorch或TensorFlow等深度学习框架。
3. 模型理解:深入理解机器学习及大模型的基础原理,熟悉常见的LLM微调技术(如LoRA, P-Tuning)及应用模式(如RAG、Agent)。
4. 评测核心能力:
- 熟悉机器学习模型的评估方法论,精通各类评估指标(如准确率、F1-score、BLEU, ROUGE,以及LLM特有的评估指标)。
- 具备强大的数据分析能力,能够通过数据洞察问题,并形成清晰的分析报告。
5. 核心素质:思维严谨,对数据敏感,具备极强的责任心和质量意识。
【优先条件(加分项)】
1.经验加分:有医疗健康、问答系统、搜索引擎等相关领域算法评测经验者优先。
2.技术加分:有使用LLM(如GPT-4, Claude)或开源模型进行自动化评测(LLM-as-a-Judge) 实践经验者优先。
3.领域加分:有医学自然语言处理(如电子病历处理、医学文献分析)相关项目经验者优先。
4.成果加分:有高质量技术博客、开源项目贡献,或在顶级会议/期刊发表相关论文者优先。