Agent Skills
返回列表
🤖

智能体评估

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/agent-evaluation-zh。

技能介绍

问题背景

LLM 智能体不是传统确定性程序:相同输入可能产生不同输出,正确答案也可能不是唯一。如果只跑一次测试、只测理想路径,或依赖输出字符串匹配,很容易在基准上通过却在生产环境失败。

技能如何工作

该技能提供一套面向智能体质量的评估方法:

  • 行为回归测试:把智能体关键行为写成可重复检查的不变量,避免功能漂移。
  • 能力评估:围绕 capability-assessment 设计任务级用例,而不是只看单轮回答。
  • 可靠性指标:通过多次运行分析通过率、延迟、失败模式等分布,而不是依赖单次结果。
  • 基准设计:将测试数据、评分规则和评测流程结构化,降低评估偏差。
  • 对抗式测试:主动构造边界输入、错误上下文和诱导性指令,检验智能体是否会被带偏。

适用边界与注意点

它适合在上线前、发布后回归、A/B 实验或红队演练中使用,尤其适合多轮对话、工具调用和自主决策类智能体。资料中提到应避免把评估集泄露到训练或提示词中,也要警惕智能体只优化指标而不完成真实任务。对强随机性的任务,建议保留运行样本、失败原因和评估版本,便于复现。

使用场景

  • 上线前对多轮对话智能体做多次采样,检查关键任务完成率是否稳定。
  • 发布后把生产高频问题整理成回归集,验证新版本没有破坏旧行为。
  • 给工具调用智能体构造越权、缺参、错误返回等对抗用例,检查失败边界。
  • 用评分规则和多次运行结果判断智能体是否只优化指标而不完成真实任务。

适合人员

  • 负责智能体上线质量把关的测试工程师,想建立可重复的行为回归集。
  • 做 LLM 应用发布的平台工程师,需要在发版前对比新旧版本稳定性。
  • 设计评测集的算法工程师,要把生产问题整理成可追踪的基准。
  • 负责红队与安全测试的安全工程师,想构造越权与诱导输入。