Agent Skills
返回列表
测一测

测一测

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_57f71de6/skill-creator-v2。

技能介绍

解决什么问题

写 Agent 技能时,常见困难不是“能不能写出一版 SKILL.md”,而是不知道它是否真的比不装技能时更好:触发是否过弱或过强,输出格式是否稳定,耗时和 token 是否可接受,多次迭代后哪些断言只是在重复确认同一件事。测一测 把这类经验性调试整理成可执行的开发流程。

技能如何工作

它先从用户意图开始,围绕四个问题推进:技能要让模型做什么、在什么上下文下触发、期望输出格式、是否需要测试用例。如果当前会话已经包含完整工作流,它也可以从历史中提取工具调用、步骤顺序、输入输出格式和用户修正,再补齐缺口。

随后进入草稿与评估闭环。关键步骤包括:

  • 编写 SKILL.md 草稿,把触发条件写进 description,并按需使用渐进式加载和领域分文件。
  • 生成 2 到 3 个真实用户会说的测试 prompt,保存到 evals/evals.json。
  • 同时启动 with-skill 与 baseline 两组运行,避免先后启动造成时间差。
  • 在运行期间草拟可客观验证的 assertions,并更新 eval_metadata.json。
  • 收集 timing.json、评分结果、benchmark.json 与 benchmark.md,再打开评审视图查看定性输出和量化指标。

它还会做一层 analyst pass,找那些始终通过的断言、高方差用例、以及 token 与耗时的 tradeoff,帮助判断下一轮该改描述、改正文,还是扩大测试集。

适用边界

这个流程更适合有明确输出、可校验结果或固定步骤的技能,例如文件转换、数据抽取、代码生成和流程化任务。对写作风格、设计质量等主观结果,资料更倾向于定性评估,不建议强行塞入量化断言。使用它时需要接受一定的运行开销:会涉及多次子任务、评分脚本和结果文件。若环境没有浏览器,可用静态评审文件替代交互式 viewer。

使用场景

  • {'text': '为数据抽取类技能写初版 SKILL.md,并生成测试 prompt 验证输出格式。'}
  • {'text': '对比带技能与不带技能的运行结果,判断新技能是否真的减少错误输出。'}
  • {'text': '给文件转换技能补充可校验断言,检查输出文件是否满足约定结构。'}
  • {'text': '优化技能描述,让模型在用户提到相关任务时更稳定地触发该技能。'}

适合人员

  • {'text': '正在把固定工具流程封装成可复用 Agent 技能的全栈工程师'}
  • {'text': '需要判断技能触发是否过弱或过强的 Prompt 工程师'}
  • {'text': '想把数据抽取、文件转换等任务做成功率验证的平台工程师'}
  • {'text': '负责维护多版本技能并需要对比新旧版本效果的 Agent 产品负责人'}