Skill 评测 Pro
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_616d1d5a/skill-evaluation-pro。
技能介绍
解决什么问题
评估本地 Skill 时,常见问题不是“能不能跑”,而是不同模型、框架和多个候选 Skill 之间差异不稳定:人工配置评测集、手动驱动模型、逐条比对输出,容易遗漏口径。Skill 评测 Pro 把评测意图转成可执行流程,覆盖单 Skill 验证、多 Skill 横评、多模型横评和运行框架横评。
如何工作
流程以对话推进:先确认评测场景,再选择待评测 Skill、驱动模型与评委模型,随后上传已有评测集或自动生成数据,最后查看云端任务摘要与评分报告。关键步骤包括:
- 场景确认:只先问评测场景,避免一开始混入模型、数据集等阶段 2/3 的决策。
- 配置构建:选择
Skill、模型与评委,确认配置。 - 数据准备:上传评测集或自动生成,并预览确认。
- 执行与报告:静默完成鉴权、打包、上传与轮询,输出结果摘要。
适用边界
它面向本地 Skill 的自动化效果评测,不替代代码评审、系统性能压测或模型训练/微调。输出强调中文交互、编号表格和结果摘要,内部命令、字段与 ID 不直接暴露。若评测目标涉及压测指标或训练管线,应另建独立流程。
使用场景
- 在候选多个本地 Skill 前,用同一任务对比它们的输出质量。
- 同一个 Skill 要接入不同模型时,检查其在目标驱动模型下的表现差异。
- 同一评测集下比较多个运行框架,确认 Skill 行为是否稳定。
- 上线前快速验证单个本地 Skill 是否符合预期输出。
适合人员
- 负责本地 Skill 质量验收的 AI 工程人员,需要统一对比不同模型输出。
- 维护多框架 Agent 应用的开发者,需要确认同一 Skill 在不同运行框架下是否一致。
- 对比多个候选 Skill 的产品或算法工程师,需要基于同一任务做横向评分。
- 准备模型切换方案的 LLM 应用工程师,需要验证目标模型上该 Skill 的表现。