Agent Skills
返回列表
Agent 自动化评测

Agent 自动化评测

AI Agent 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_055bebc4/agent-eval-skill

技能介绍

要解决的问题

Agent 评测常卡在先写代码再补口径:没有明确 payload、指标从哪来、标签边界如何划、trajectory 与 E2E 是否共用同一份输入,最后分数只能反映模型印象。本技能把问题拆成前置对齐、指标设计、payload 设计和输出链路,尤其适合手上已有 Agent 代码、Langfuse trace、导出 trace 文件,但还不确定该评什么、怎么评、分数落到哪里的场景。

核心工作方式

  • 先做 discovery,不急着写 judge:确认评测项目位置、配置位置、代码落点、trace 数据入口、DB / SDK / API 可用路径、默认 judge 模型和输出目标。
  • 从代码事实反推指标:优先扫描入口、prompt、tool、routing、trace metadata 和最终出口,再推荐少量细粒度的 trajectory 与 E2E 指标,并要求用户确认接受、删除、新增或只观察。
  • 按指标组织证据:为每个 payload block 标注字段、来源、价值等级、fallback 和长度预算,避免所有指标共用完整 payload 导致分数一起高、一起低。
  • 标签先于评分逻辑:先确定特殊标签边界,再讨论哪些 case 执行 trajectory、哪些只评 E2E,哪些标签只观察不改变分数。
  • 输出路径默认务实:优先考虑 Langfuse score 回写、evaluator prompt、报告或数据库输出;若只先做设计,也先产出可确认的 spec 和开发 checklist。

适用边界

它不适合纯 BI 看板、产品数据分析,或没有 Agent 代码与 trace 结构的通用模型 benchmark。资料不完整时可以继续 reduced-scope,但字段 fallback、临时替代和延后验证都需要用户明确接受。

使用场景

  • 已有 Langfuse trace 和本地 agent 代码,需要设计可复用的 trajectory 与 E2E 评分指标。
  • 评测项目没有现成 payload 和标签,需要先确认字段来源、fallback 和评分口径再实现。
  • 已有旧评测脚本,想盘点可复用组件,把规则判定改成 LLM judge 并输出 Langfuse score。
  • trace 数据不完整,需要产出 reduced-scope 评测方案,标明缺失字段与延后验证条件。

适合人员

  • 负责 Langfuse 接入的算法工程师,想把 trace 变成可复核的评分输入。
  • 维护 Agent 产品的后端工程师,需要在不重写服务前设计 trajectory 与 E2E 评测。
  • 做模型应用质量的全栈工程师,需要把 judge 结果写回 Langfuse 或报告。
  • 带小团队做 Agent 验收的产品工程负责人,需要先用 spec 对齐指标和标签边界。