Agent Skills
返回列表
Skill 评测 Pro

Skill 评测 Pro

AI Agent 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_616d1d5a/skill-evaluation-pro。

技能介绍

解决什么问题

评估本地 Skill 时,常见问题不是“能不能跑”,而是不同模型、框架和多个候选 Skill 之间差异不稳定:人工配置评测集、手动驱动模型、逐条比对输出,容易遗漏口径。Skill 评测 Pro 把评测意图转成可执行流程,覆盖单 Skill 验证、多 Skill 横评、多模型横评和运行框架横评。

如何工作

流程以对话推进:先确认评测场景,再选择待评测 Skill、驱动模型与评委模型,随后上传已有评测集或自动生成数据,最后查看云端任务摘要与评分报告。关键步骤包括:

  • 场景确认:只先问评测场景,避免一开始混入模型、数据集等阶段 2/3 的决策。
  • 配置构建:选择 Skill、模型与评委,确认配置。
  • 数据准备:上传评测集或自动生成,并预览确认。
  • 执行与报告:静默完成鉴权、打包、上传与轮询,输出结果摘要。

适用边界

它面向本地 Skill 的自动化效果评测,不替代代码评审、系统性能压测或模型训练/微调。输出强调中文交互、编号表格和结果摘要,内部命令、字段与 ID 不直接暴露。若评测目标涉及压测指标或训练管线,应另建独立流程。

使用场景

  • 在候选多个本地 Skill 前,用同一任务对比它们的输出质量。
  • 同一个 Skill 要接入不同模型时,检查其在目标驱动模型下的表现差异。
  • 同一评测集下比较多个运行框架,确认 Skill 行为是否稳定。
  • 上线前快速验证单个本地 Skill 是否符合预期输出。

适合人员

  • 负责本地 Skill 质量验收的 AI 工程人员,需要统一对比不同模型输出。
  • 维护多框架 Agent 应用的开发者,需要确认同一 Skill 在不同运行框架下是否一致。
  • 对比多个候选 Skill 的产品或算法工程师,需要基于同一任务做横向评分。
  • 准备模型切换方案的 LLM 应用工程师,需要验证目标模型上该 Skill 的表现。