测一测
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_57f71de6/skill-creator-v2。
技能介绍
解决什么问题
写 Agent 技能时,常见困难不是“能不能写出一版 SKILL.md”,而是不知道它是否真的比不装技能时更好:触发是否过弱或过强,输出格式是否稳定,耗时和 token 是否可接受,多次迭代后哪些断言只是在重复确认同一件事。测一测 把这类经验性调试整理成可执行的开发流程。
技能如何工作
它先从用户意图开始,围绕四个问题推进:技能要让模型做什么、在什么上下文下触发、期望输出格式、是否需要测试用例。如果当前会话已经包含完整工作流,它也可以从历史中提取工具调用、步骤顺序、输入输出格式和用户修正,再补齐缺口。
随后进入草稿与评估闭环。关键步骤包括:
- 编写
SKILL.md草稿,把触发条件写进description,并按需使用渐进式加载和领域分文件。 - 生成 2 到 3 个真实用户会说的测试 prompt,保存到
evals/evals.json。 - 同时启动
with-skill与baseline两组运行,避免先后启动造成时间差。 - 在运行期间草拟可客观验证的 assertions,并更新
eval_metadata.json。 - 收集
timing.json、评分结果、benchmark.json与benchmark.md,再打开评审视图查看定性输出和量化指标。
它还会做一层 analyst pass,找那些始终通过的断言、高方差用例、以及 token 与耗时的 tradeoff,帮助判断下一轮该改描述、改正文,还是扩大测试集。
适用边界
这个流程更适合有明确输出、可校验结果或固定步骤的技能,例如文件转换、数据抽取、代码生成和流程化任务。对写作风格、设计质量等主观结果,资料更倾向于定性评估,不建议强行塞入量化断言。使用它时需要接受一定的运行开销:会涉及多次子任务、评分脚本和结果文件。若环境没有浏览器,可用静态评审文件替代交互式 viewer。
使用场景
- {'text': '为数据抽取类技能写初版 SKILL.md,并生成测试 prompt 验证输出格式。'}
- {'text': '对比带技能与不带技能的运行结果,判断新技能是否真的减少错误输出。'}
- {'text': '给文件转换技能补充可校验断言,检查输出文件是否满足约定结构。'}
- {'text': '优化技能描述,让模型在用户提到相关任务时更稳定地触发该技能。'}
适合人员
- {'text': '正在把固定工具流程封装成可复用 Agent 技能的全栈工程师'}
- {'text': '需要判断技能触发是否过弱或过强的 Prompt 工程师'}
- {'text': '想把数据抽取、文件转换等任务做成功率验证的平台工程师'}
- {'text': '负责维护多版本技能并需要对比新旧版本效果的 Agent 产品负责人'}