日志异常检测
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f12a44b7/cnbll-log-anomaly-detect。
技能介绍
问题:工人状态异常往往先表现为日志堆积
在持续巡检中,工程师通常要快速判断哪些 worker 需要人工介入。常见信号是 pending 堆积、done=0、lastActive 长时间未更新,以及反复失败或零产出。如果只靠人工查看 Dashboard,容易漏掉边界案例,也难以留下一致结论。
工作方式:基于规则的状态巡检
该技能围绕 Dashboard API 做一次轻量异常检测:
- 拉取数据:通过
GET请求获取全部 workers 状态,并使用Authorization: Bearer {TOKEN}完成认证。 - 规则判定:逐个应用阈值规则,例如
pending>10 且 done=0表示严重积压,pending>5表示任务堆积。 - 输出结果:汇总异常列表,标记可能离线、零产出等状态;可选发送告警到群聊。
适用边界
它适合做周期性健康快照和异常报告,不是实时流式诊断。判定依赖 API 字段完整性,lastActive、todayDone、pending 的语义需要与业务保持一致;阈值更像运维告警规则,可按环境调整,但不应替代根因排查。
使用场景
- 定时巡检时判断哪些 worker 长时间无响应或 pending 堆积
- 发现某 worker pending>10 且 done=0 时定位严重积压
- 汇总异常 worker 列表并生成可发送群聊的异常报告
- 根据 lastActive、todayDone 等字段判断离线与零产出
适合人员
- 负责服务巡检的 SRE,需要定期判断 worker 健康状态
- 运维工程师,需要在 pending 堆积时定位异常实例
- 平台研发,需要把 API 状态数据整理成异常报告
- 值班负责人,需要在群聊中同步 worker 离线与零产出