职位描述
1. 参与基础模型、多模态、语音、Agent 等方向的评测方案、数据集和自动化工具建设,支持模型研发、版本迭代及真实业务场景的效果评估。
2. 分析不同模型和版本的能力变化、典型失败模式及潜在风险,为数据构建、模型优化、推理策略和产品迭代提出评测建议,并推动改进效果验证。
3. 研究模型能力的形成、涌现与退化,探索不同训练阶段、模型规模和推理方式对模型能力变化的影响。
4. 面向长文本、多轮交互、复杂推理、工具调用和 Agent 长程任务,设计更贴近真实世界、能够揭示模型能力边界的评测任务与环境。
5. 研究 LLM-as-a-Judge 的偏差、稳定性、可解释性和与人工评测一致性,探索评测数据自动生成、对抗评测和自动化红队等方法。
6. 跟踪并复现大模型评测领域的前沿研究,与模型、数据、产品和工程团队协作,从实际问题中提炼研究课题,形成实验结论、研究原型或可复用的方法与工具。任职要求
1.计算机、人工智能、数学、统计学等相关专业本科及以上在读;
2.具备机器学习、自然语言处理、计算机视觉、语音、多模态或 Agent 等方向的基础;
3.熟练掌握 Python,具备数据处理、实验分析和代码实现能力;
4.善于提出问题、设计实验和分析结果,对大模型技术及其能力边界有强烈兴趣;
5.具备 AI Native 的工作方式,能够熟练使用大模型及相关工具辅助资料分析、代码开发、数据构造和实验迭代,并能对模型输出进行判断、验证和改进。
加分项
1.有大模型、机器学习、自然语言处理、多模态或 Agent 相关项目、科研或实习经历;
2.了解模型评测、LLM-as-a-Judge、模型对齐、Agent、模型安全或自动化评测等方向;
3.有评测集构建、数据分析、实验平台开发,或使用大模型辅助研究和工程实践的经验;
4.有高水平论文、开源项目、算法竞赛、技术报告或其他能够体现研究与实践能力的成果。