OpenClaw 弹性监控
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-resilience-monitor。
技能介绍
问题背景
Agent 调用 LLM API 时,429、503、超时、网络抖动等错误会打断任务,而原始日志通常分散在不同请求和实例中。排查时往往要翻日志、按模型核对、再确认重试记录,过程比较零散,也难以快速判断某个模型是否异常、某类错误是否可重试、任务是否已恢复。
工作方式
该技能为 OpenClaw 增加自然语言入口,用于查看错误统计、管理重试策略、打开面板和生成报告:
resilience_stats:按today、hour、week或模型名查询错误率与模型分布。resilience_strategies:列出、新增、修改或重置重试策略,支持固定间隔、指数退避和自定义间隔。resilience_report:生成日报、单模型报告、任务恢复报告或完整状态报告。resilience_dashboard:打开本地实时面板,查看当前错误、模型统计、最近错误和策略卡片。
例如,可以用自然语言查询某个模型的今日错误率,再把默认超时策略改成指数退避。技能把错误归入 rate_limit、timeout、auth_failed、context_too_long 等类别,并标明哪些类别可重试;实际工具注册、自动记录、重试引擎和 Dashboard 服务由配套插件完成。
适用边界
它面向已经接入 OpenClaw 并希望用中文指令查看 API 健康度的工程场景。若未安装或加载配套插件,工具调用会失败,面板也不会启动;策略修改通常只作用于本地 Gateway 实例。
使用场景
- OpenClaw 网关调用多个模型出现 429 或超时,需要按天、按小时或按模型查错误率并定位异常模型。
- 排查 Agent 重试记录时,需要查看默认指数退避、固定间隔或自定义策略,并修改超时重试策略。
- 生成当日错误日报或单模型报告,向团队说明 rate_limit、timeout 等错误是否可重试和恢复情况。
- 本地 OpenClaw Dashboard 需要打开、停止或查看状态,以跟踪当前活跃重试和模型错误分布。
适合人员
- 维护 OpenClaw 网关的 SRE,希望用自然语言查看 API 健康度、错误分类和重试策略状态。
- 使用多模型 Agent 的后端工程师,需要按模型排查 429、超时和模型不可用等错误。
- 负责 Agent 任务可靠性的工程师,希望生成错误日报并确认任务是否进入重试或恢复。
- 搭建本地 AI 运维面板的平台工程师,需要打开 Dashboard 查看实时错误和策略卡片。