Agent Skills
返回列表
子代理健康巡检守护

子代理健康巡检守护

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-subagent-overseer。

技能介绍

要解决的问题

多代理系统里,主代理往往要频繁确认子代理是否卡住,但轮询、日志抓取和自然语言汇报都会引入额外模型调用与噪音。subagent-overseer 的目标是把巡检下沉为轻量守护进程:只采集会话、进程和文件变化,不替主代理做决策。

工作方式

它按 --interval 周期运行,默认 180 秒。每个周期会读取网关 /proc 数据、调用一次 openclaw sessions list,并通过 find -newer 检查 --workdir 下是否有文件写入。随后把结果原子化写入 /tmp/overseer/status.json,包含 subagents.count、subagents.details[].stale、subagents.details[].status 等字段。

心跳侧只需读这个文件:

  • 文件缺失或超过 10 分钟未更新时,重启 overseer;
  • 所有子代理正常时,输出一行状态并结束;
  • 出现 warning 或 stuck 时,报告对应标签,必要时 kill。

它还会用 flock 去重,避免多实例竞争;若连续两个周期没有子代理,则自动退出。语音告警可选,走本地 TTS,不增加云端模型开销。

适用边界

这个技能适合监控本地多代理任务、长时运行会话或网关健康,不适合替代真实任务调度器或分布式观测系统。阈值默认偏向少打扰:stale 到 4 才视为卡住,因此对高并发、短周期任务的异常可能需要调低 --interval 和 --max-stale。另外,它依赖 openclaw、/tmp/overseer、jarvis 等本地约定,迁移环境时需确认路径和命令可用。

使用场景

  • 在多个 openclaw 子代理跑长任务时,定期巡检会话是否 active、idle 或 stuck,避免主代理反复抓日志。
  • 当本地 openclaw-gateway 长时间运行后,读取 /proc 健康指标并写入状态文件,便于心跳判断是否需要重启。
  • 在代码或文档生成任务中,用工作目录文件变化判断子代理是否仍在推进,减少无意义模型查询。
  • 当多个带标签子代理并行处理任务时,汇总 warning/stuck 标签并给出可 kill 的巡检结论。

适合人员

  • 需要监控多个本地 openclaw 子代理是否卡住的 Agent 工程师。
  • 要在长时运行代理任务中用低模型成本做状态巡检的自动化工程师。
  • 需要把子代理会话健康写入状态文件并触发心跳处理的多代理开发者。
  • 需要跟踪工作目录文件写入以判断子代理是否还在推进的本地开发运维。