SkillsBench Skill 评测工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f37e97ba/skillsbench-evaluator。
技能介绍
解决的问题
许多 Agent 技能库已经积累了大量 SKILL.md,但缺少可复核的质量判断:哪些技能能稳定触发,哪些只是把流程写得更顺眼;哪些会误导模型,哪些能减少错误。人工审阅难以量化,批量维护更缺少共同标尺。
skillsbench-evaluator 用一套固定评分规则把技能变成可比较的资产。它不依赖主观印象,而是要求每个维度引用 SKILL.md 原文作为证据,再给出总分、等级和修复建议。
工作方式
- 单技能评测:定位技能目录,完整读取
SKILL.md及其references/结构,按references/rubric.md的 12 个维度逐项打0或1分。 - 证据评分:每个维度分数后标注原文依据,避免“可能想表达什么”的猜测;报告按总分归入 基石层、专业层、精品层。
- 批量评测:扫描
~/.workbuddy/skills/下所有技能,输出排行榜、维度热力图,以及跨技能重复出现的系统性缺陷。 - 修复建议:对失分维度生成可执行建议,优先提示
触发条件、指令结构、陷阱、工具控制等高风险项。
它适合用于技能库治理、发布前评审和同类 Agent 技能对比。注意:评分高度依赖 SKILL.md 与 rubric.md 的匹配程度,模板或规则变更后结果可能变化;该工具更适合评估“技能文档是否可执行”,不能替代真实任务中的 A/B 测试或生产环境验证。
使用场景
- 在技能库发布前,逐个检查 SKILL.md 的触发条件、指令结构和工具控制是否达标。
- 维护多个 Agent 技能时,批量扫描目录并输出分数排行榜、维度热力图和共性缺陷。
- 评审某个工作流技能时,按 12 个维度引用原文证据打分,并生成可执行修复建议。
- 对比两类工具型技能时,检查触发条件、陷阱和约束项,判断哪个更容易稳定调用。
适合人员
- 负责 Agent 技能库发布的工程师,需要在上线前确认 SKILL.md 是否达到可执行标准。
- 维护工作流型技能的开发者,需要比较多个版本的触发条件、指令结构和陷阱描述。
- 治理企业技能目录的平台负责人,需要把分散的 SKILL.md 纳入统一评分与排行榜。
- 编写工具型技能的工程师,需要知道哪些维度失分会影响调用成功率、错误率或安全性。