职位描述
核心职责:
- 构建评价体系:针对无人车Agent的业务场景,根据Agent能力的进化,持续构建并维护高质量的测试集。设计多维度的评测指标(如:意图准确率、任务达成率等)。
- 自动化评测与监控:开发基于大模型的自动化评测后台,利用大模型能力对 Agent 的日常对话和指令输出进行规模化打分。建立 Bad Case 自动化预警机制,从海量日志中精准捞取长尾场景。
- 业务洞察与策略迭代:定期产出评测报告,量化版本迭代的效果变化,为 PM 提供策略优化方向。深度参与 Bad Case 复盘,协同开发定位是 RAG 检索、Prompt 逻辑还是底层模型的问题。
- 设计数据闭环与埋点:负责 客户端及服务端全链路埋点方案设计,确保 Agent 的感知、决策、执行过程数据可溯源、可回放。任职要求
任职要求
- 技术、数据背景: 3年以上 AI 评测、数据分析或策略产品经验。熟悉 Python,熟练使用Claude等AI Coding工具,
- 能独立编写自动化脚本及数据处理工具;熟练使用 SQL。
- AI 认知:深刻理解 LLM/Agent 的工作原理,有 Prompt Engineering 经验,熟悉常用评测框架。
- 数据能力: 具备严谨的数据设计思路,了解埋点上报、清洗、分析的全流程,能够从混乱的日志中抽象出业务逻辑。
- 行业经验: 具有自动驾驶、大模型测评、Agent测评或背景者优先,习惯处理复杂的软硬件协同数据。
- 软素质: 极强的逻辑推导能力,对“数据真实性”有洁癖,能够抗住产研节奏压力,坚持质量底线。
加分项
- 有成功搭建从 0 到 1 的 AI 自动化评测经验。
- 在 GitHub 有相关数据闭环或测试工具库的开源贡献。
- 对车辆、具身智能或Agent实际交互场景有实际经验及深度理解。