Agent Skills
返回列表
AI Agent 安全红队测试

AI Agent 安全红队测试

IT 运维与安全 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_4b84a253/123123123123123123 到你的 AI 助手中。

技能介绍

解决什么问题

当 AI Agent 允许加载第三方 Skill 时,风险往往不在模型本身,而在 Skill 携带的提示词、工具参数和外部链接。恶意 Skill 可能诱导 Agent 执行越狱指令、绕过安全策略,或访问不受信任的 URL。常规功能测试只能判断“能不能用”,难以回答“会不会被利用”。

技能如何工作

该 Skill 面向 AI Agent 安全红队测试,围绕 越狱攻击防御、恶意指令识别、URL 访问控制 等风险项组织评估视角。使用时可以提供攻击样本、异常指令、可疑链接或 Skill 加载场景,在受控输入下观察 Agent 的安全响应。

  • 威胁视角:检查越狱尝试、恶意指令识别、可疑 URL 访问等典型风险。
  • 评估方式:观察 Agent 是否拒绝、降权、审计或阻断异常请求。

适用边界

重点在于 Skill 加载后的安全防御 与 第三方输入触发下的 Agent 行为。如果被测系统缺少日志、权限隔离或策略执行机制,测试结果只能说明当前控制是否触发,不能替代完整渗透测试或证明生产环境绝对安全。

使用场景

  • 在上线前向 AI Agent 提交越狱样本,确认其加载第三方 Skill 后仍会拒绝危险指令。
  • 构造含恶意指令的 Skill 提示词,观察 Agent 是否识别异常并阻止工具调用或输出。
  • 注入指向外部可疑 URL 的 Skill 参数,检查 Agent 的 URL 访问控制是否拦截请求。
  • 在红队评审中批量复测 Skill 注入场景,记录 Agent 的拒绝、降权或审计表现。

适合人员

  • 负责 AI Agent 平台安全评审的平台安全工程师,需要在上线前验证第三方 Skill 的越狱防御表现。
  • 管理内部 LLM Agent 的 IT 运维安全负责人,需要排查加载 Skill 后恶意指令识别和 URL 控制是否生效。
  • 做 LLM 应用测试的测试工程师,需要向 Agent 注入 Skill 攻击样本并记录安全响应。
  • 维护安全运营审计流程的安全运营人员,需要复核 Agent 对可疑 URL 和异常指令的阻断记录。