职位描述
1、面向真实用户和业务场景,参与大模型评测体系建设,探索更贴近实际使用效果的评测方法;
2、负责评测数据构建、评测标准设计与结果分析,发现模型问题并推动效果优化;
3、参与评测工具与流程开发,提升评测效率,为模型的迭代优化提供支持。任职要求
1、熟练掌握 Python,具备良好的编程和数据处理能力;
2、熟悉大语言模型,能够利用大模型开展数据构造、分析与自动化评测;
3、具备良好的问题拆解和实验分析能力,能够将业务需求转化为评测方案;
4、有 NLP、大模型评测或数据挖掘相关经验者优先;
5、具备技术调研和自主推进能力,沟通协作良好,对大模型应用有兴趣。