职位描述
职位概览
我们正在寻找一位对 Agentic AI 评测体系充满热情的产品实习生,加入阶跃星辰核心产品团队,参与前沿大模型评测框架的设计与落地。
核心职责
Agentic 评测体系设计 负责 Agentic AI 产品的评测体系搭建,设计覆盖任务规划、工具调用、多轮决策、自我修正等核心能力的评估维度。构建可量化、可复现的评测指标,建立从单步动作到端到端任务完成度的完整评估链路。探索 Agent 在复杂场景(如代码生成、数据分析、多工具协同)中的能力边界评测方法。
前沿 Benchmark 对接与研究 持续追踪并对接 SWE-bench、AgentBench、WebArena、OSWorld 等国际前沿评测基准。研究最新评测方法论(如 LLM-as-a-Judge、Human-in-the-loop 评估、对抗性评测等),推动内部评测能力迭代升级。分析行业评测趋势,输出评测技术洞察报告,为产品技术路线提供决策支持。
业务评测接入与框架设计 对接各业务线的评测需求,设计通用化、可扩展的评测框架与平台。推动评测流程标准化,建设从数据构造、模型推理、结果分析到报告生成的全链路评测基础设施。协同算法、工程团队,将评测体系嵌入 CI/CD 流程,实现模型迭代的自动化评估与回归监控。
我们期待你具备
硬性能力: AI Coding & 数据处理能力:熟练使用 Python 进行数据分析和自动化脚本开发,具备处理大规模评测数据的经验,熟悉 Pandas、NumPy 等工具链。 技术理解力:对大模型、Agent 技术栈有基本认知,了解 Prompt Engineering、RAG、Function Calling 等核心概念。 产品思维:具备结构化思考能力,能将技术评测需求转化为可执行的产品方案。
加分项: 有 AI / 大模型相关产品实习经验,参与过模型评测、数据标注平台或 AI 应用的产品设计;熟悉至少一个主流大模型评测框架(如 OpenCompass、EleutherAI LM Evaluation Harness)。
允许3个月内投递4个职位,请选择适合的职位进行投递
立即投递