Ivyea Jobs 14689 roles · 245 companies · 1 小时前
面壁智能 · 大模型

大模型评测算法实习生

职位描述

1. 参与基础模型、多模态、语音、Agent 等方向的评测方案、数据集和自动化工具建设,支持模型研发、版本迭代及真实业务场景的效果评估。 2. 分析不同模型和版本的能力变化、典型失败模式及潜在风险,为数据构建、模型优化、推理策略和产品迭代提出评测建议,并推动改进效果验证。 3. 研究模型能力的形成、涌现与退化,探索不同训练阶段、模型规模和推理方式对模型能力变化的影响。 4. 面向长文本、多轮交互、复杂推理、工具调用和 Agent 长程任务,设计更贴近真实世界、能够揭示模型能力边界的评测任务与环境。 5. 研究 LLM-as-a-Judge 的偏差、稳定性、可解释性和与人工评测一致性,探索评测数据自动生成、对抗评测和自动化红队等方法。 6. 跟踪并复现大模型评测领域的前沿研究,与模型、数据、产品和工程团队协作,从实际问题中提炼研究课题,形成实验结论、研究原型或可复用的方法与工具。

任职要求

1.计算机、人工智能、数学、统计学等相关专业本科及以上在读; 2.具备机器学习、自然语言处理、计算机视觉、语音、多模态或 Agent 等方向的基础; 3.熟练掌握 Python,具备数据处理、实验分析和代码实现能力; 4.善于提出问题、设计实验和分析结果,对大模型技术及其能力边界有强烈兴趣; 5.具备 AI Native 的工作方式,能够熟练使用大模型及相关工具辅助资料分析、代码开发、数据构造和实验迭代,并能对模型输出进行判断、验证和改进。 加分项 1.有大模型、机器学习、自然语言处理、多模态或 Agent 相关项目、科研或实习经历; 2.了解模型评测、LLM-as-a-Judge、模型对齐、Agent、模型安全或自动化评测等方向; 3.有评测集构建、数据分析、实验平台开发,或使用大模型辅助研究和工程实践的经验; 4.有高水平论文、开源项目、算法竞赛、技术报告或其他能够体现研究与实践能力的成果。
面壁智能去官方页面投递 →