Ivyea Jobs 8332 roles · 120 companies · 刚刚
新石器 · 具身智能

Agent 评测工程师

北京 社招 · 全职 Agent / 应用算法

职位描述

核心职责: - 构建评价体系:针对无人车Agent的业务场景,根据Agent能力的进化,持续构建并维护高质量的测试集。设计多维度的评测指标(如:意图准确率、任务达成率等)。 - 自动化评测与监控:开发基于大模型的自动化评测后台,利用大模型能力对 Agent 的日常对话和指令输出进行规模化打分。建立 Bad Case 自动化预警机制,从海量日志中精准捞取长尾场景。 - 业务洞察与策略迭代:定期产出评测报告,量化版本迭代的效果变化,为 PM 提供策略优化方向。深度参与 Bad Case 复盘,协同开发定位是 RAG 检索、Prompt 逻辑还是底层模型的问题。 - 设计数据闭环与埋点:负责 客户端及服务端全链路埋点方案设计,确保 Agent 的感知、决策、执行过程数据可溯源、可回放。

任职要求

任职要求 - 技术、数据背景: 3年以上 AI 评测、数据分析或策略产品经验。熟悉 Python,熟练使用Claude等AI Coding工具, - 能独立编写自动化脚本及数据处理工具;熟练使用 SQL。 - AI 认知:深刻理解 LLM/Agent 的工作原理,有 Prompt Engineering 经验,熟悉常用评测框架。 - 数据能力: 具备严谨的数据设计思路,了解埋点上报、清洗、分析的全流程,能够从混乱的日志中抽象出业务逻辑。 - 行业经验: 具有自动驾驶、大模型测评、Agent测评或背景者优先,习惯处理复杂的软硬件协同数据。 - 软素质: 极强的逻辑推导能力,对“数据真实性”有洁癖,能够抗住产研节奏压力,坚持质量底线。 加分项 - 有成功搭建从 0 到 1 的 AI 自动化评测经验。 - 在 GitHub 有相关数据闭环或测试工具库的开源贡献。 - 对车辆、具身智能或Agent实际交互场景有实际经验及深度理解。
新石器去官方页面投递 →