Agent Skills
返回列表
SkillsBench Skill 评测工具

SkillsBench Skill 评测工具

开发编程 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f37e97ba/skillsbench-evaluator。

技能介绍

解决的问题

许多 Agent 技能库已经积累了大量 SKILL.md,但缺少可复核的质量判断:哪些技能能稳定触发,哪些只是把流程写得更顺眼;哪些会误导模型,哪些能减少错误。人工审阅难以量化,批量维护更缺少共同标尺。

skillsbench-evaluator 用一套固定评分规则把技能变成可比较的资产。它不依赖主观印象,而是要求每个维度引用 SKILL.md 原文作为证据,再给出总分、等级和修复建议。

工作方式

  • 单技能评测:定位技能目录,完整读取 SKILL.md 及其 references/ 结构,按 references/rubric.md 的 12 个维度逐项打 0 或 1 分。
  • 证据评分:每个维度分数后标注原文依据,避免“可能想表达什么”的猜测;报告按总分归入 基石层、专业层、精品层。
  • 批量评测:扫描 ~/.workbuddy/skills/ 下所有技能,输出排行榜、维度热力图,以及跨技能重复出现的系统性缺陷。
  • 修复建议:对失分维度生成可执行建议,优先提示 触发条件、指令结构、陷阱、工具控制 等高风险项。

它适合用于技能库治理、发布前评审和同类 Agent 技能对比。注意:评分高度依赖 SKILL.md 与 rubric.md 的匹配程度,模板或规则变更后结果可能变化;该工具更适合评估“技能文档是否可执行”,不能替代真实任务中的 A/B 测试或生产环境验证。

使用场景

  • 在技能库发布前,逐个检查 SKILL.md 的触发条件、指令结构和工具控制是否达标。
  • 维护多个 Agent 技能时,批量扫描目录并输出分数排行榜、维度热力图和共性缺陷。
  • 评审某个工作流技能时,按 12 个维度引用原文证据打分,并生成可执行修复建议。
  • 对比两类工具型技能时,检查触发条件、陷阱和约束项,判断哪个更容易稳定调用。

适合人员

  • 负责 Agent 技能库发布的工程师,需要在上线前确认 SKILL.md 是否达到可执行标准。
  • 维护工作流型技能的开发者,需要比较多个版本的触发条件、指令结构和陷阱描述。
  • 治理企业技能目录的平台负责人,需要把分散的 SKILL.md 纳入统一评分与排行榜。
  • 编写工具型技能的工程师,需要知道哪些维度失分会影响调用成功率、错误率或安全性。