AI Agent 安全红队测试
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_4b84a253/123123123123123123 到你的 AI 助手中。
技能介绍
解决什么问题
当 AI Agent 允许加载第三方 Skill 时,风险往往不在模型本身,而在 Skill 携带的提示词、工具参数和外部链接。恶意 Skill 可能诱导 Agent 执行越狱指令、绕过安全策略,或访问不受信任的 URL。常规功能测试只能判断“能不能用”,难以回答“会不会被利用”。
技能如何工作
该 Skill 面向 AI Agent 安全红队测试,围绕 越狱攻击防御、恶意指令识别、URL 访问控制 等风险项组织评估视角。使用时可以提供攻击样本、异常指令、可疑链接或 Skill 加载场景,在受控输入下观察 Agent 的安全响应。
- 威胁视角:检查越狱尝试、恶意指令识别、可疑 URL 访问等典型风险。
- 评估方式:观察 Agent 是否拒绝、降权、审计或阻断异常请求。
适用边界
重点在于 Skill 加载后的安全防御 与 第三方输入触发下的 Agent 行为。如果被测系统缺少日志、权限隔离或策略执行机制,测试结果只能说明当前控制是否触发,不能替代完整渗透测试或证明生产环境绝对安全。
使用场景
- 在上线前向 AI Agent 提交越狱样本,确认其加载第三方 Skill 后仍会拒绝危险指令。
- 构造含恶意指令的 Skill 提示词,观察 Agent 是否识别异常并阻止工具调用或输出。
- 注入指向外部可疑 URL 的 Skill 参数,检查 Agent 的 URL 访问控制是否拦截请求。
- 在红队评审中批量复测 Skill 注入场景,记录 Agent 的拒绝、降权或审计表现。
适合人员
- 负责 AI Agent 平台安全评审的平台安全工程师,需要在上线前验证第三方 Skill 的越狱防御表现。
- 管理内部 LLM Agent 的 IT 运维安全负责人,需要排查加载 Skill 后恶意指令识别和 URL 控制是否生效。
- 做 LLM 应用测试的测试工程师,需要向 Agent 注入 Skill 攻击样本并记录安全响应。
- 维护安全运营审计流程的安全运营人员,需要复核 Agent 对可疑 URL 和异常指令的阻断记录。