职位描述1. 针对文本和多模态大模型, 设计、构造、实现可信评测体系, 为跨模型对照和同模型对齐提供坚实依据。 2. 从评测角度出发完善模型行为的解释性工作。 3. 持续优化评测数据与工程, 追求极致的严谨和清晰。 4. 主导日常评测工作的体系化建设与新功能设计、参与关键评审与实现。 5. 推动上下游各团队, 积极合理充分地发掘并使用相关资源。任职要求1. 计算机及相关专业, 本科及以上学历。 2. 在一个或多个机器学习领域有一定程度的算法视角经验, 具备模型算法能力分析所需的直觉、严谨意识和扎实的数学基础。 3. 对文本和多模态大模型的推理流程、上层应用、能力边界有基本认知, 了解常见的评测流程。 4. 有扎实的编程能力和良好的代码品味, 对大型生产系统的工程设计有基本理解。 5. 有良好的团队沟通和协作能力, 有良好的责任心。 6. 有良好的自驱力和学习能力。 加分项: 在一个或多个机器学习领域的深入算法研究经历。