群组健康监控
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f12a44b7/cnbll-group-health-monitor。
技能介绍
问题背景
多 Agent 群组里,单个 worker 掉线、任务停滞、消息无人响应,往往要到业务结果异常时才被发现。这个技能把“群健康”拆成可观测指标:全员在线率、当日任务完成率、inbox 响应延迟,并给出可复核的告警级别。
核心工作流
技能通常由 cron 定时触发(推荐每 15 分钟),也可在需要查看团队状态时手动运行。它会从 Dashboard API 获取 workers 数据,再按规则计算指标:
- 在线状态:
lastActive超过 30 分钟标记idle,超过 2 小时标记offline - 任务完成率:用
todayDone / (todayDone + pending)计算当日完成率;低于 30% 标记低效,todayDone = 0且pending > 0标记零产出 - 响应延迟:统计
inbox任务从创建到inProgress/done的耗时;超过 1 小时为延迟,超过 4 小时为严重延迟
随后生成三级告警:
| 级别 | 典型条件 |
|---|---|
| CRITICAL | 多人同时 offline、零产出人数超过半数 |
| WARN | 单人零产出、任务延迟超过 1 小时、完成率低于 30% |
| INFO | 单人 idle、完成率偏低、周期趋势变化 |
告警通过 Dashboard API 的 POST 接口发送到群聊,需要配置 DASHBOARD_TOKEN。阈值如 IDLE_THRESHOLD、OFFLINE_THRESHOLD、DELAY_WARN、DELAY_CRIT 可按环境调整。
适用边界
该技能适合有统一 Dashboard API 和 workers 状态字段的 Agent 群组。若团队没有可靠的 lastActive、pending、todayDone 或 inbox 状态流,指标会失真。告警只是提醒,不自动修复任务;需要人工或后续 Agent 介入处理掉线与零产出。
使用场景
- 多 Agent 群每 15 分钟定时检查在线率、完成率与 inbox 延迟,并把异常推送群聊。
- 值班工程师发现多人 offline 或零产出,查看 CRITICAL/WARN 告警后定位掉线 Worker。
- 运营每天复盘任务停滞,统计 pending、todayDone、响应延迟,确认低效与零产出来源。
- 平台维护团队按环境调整 idle、offline、delay 阈值,验证 Dashboard API 告警发送是否生效。
适合人员
- 管理多 Agent 群组的负责人:需要快速判断哪些 worker 掉线、停滞或响应过慢。
- 负责 AI Agent 平台运维的工程师:需要把 worker 状态与 inbox 延迟纳入定时巡检和告警。
- 使用群聊协同任务的运营:需要每日复盘零产出、低完成率和任务延迟来源。
- 构建 Agent 运行面板的开发者:需要基于 Dashboard API 数据输出三级健康告警。