Agent Skills
返回列表
DevOps 监控与告警

DevOps 监控与告警

IT 运维与安全 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_25ab92ec/devops-monitor。

技能介绍

要解决的问题

在小型 DevOps 场景中,监控常卡在几类具体问题上:HTTP 服务是否可达、依赖端口是否存活、进程日志是否出现异常模式、巡检结果是否只能靠人工整理。若阈值写死,抖动会产生大量误报;若只看单点状态,又无法发现日志里的趋势性异常。

工作方式

devops-monitor 围绕健康检查、告警、日志分析和巡检报告组织工作:

  • 健康检查:支持 HTTP/HTTPS、TCP 端口和 Ping,用于判断服务入口、依赖组件和网络连通性是否可用。
  • 智能告警:使用动态阈值替代固定阈值,降低短暂波动造成的误报。
  • 日志分析:读取日志文件,尝试自动发现重复错误、异常增长或明显异常模式。
  • 自动巡检:按定时任务执行检查并生成巡检报告,便于沉淀结果。

适用边界

该技能对 HTTP/HTTPS、TCP、Ping 和日志文件支持较完整,Prometheus 仅部分支持。它更适合做轻量监控、告警和巡检辅助,不应替代完整 APM、日志平台或 Prometheus 生态。若需要指标存储、分布式追踪或复杂容量规划,仍需接入专门平台。

使用场景

  • 为线上服务配置 HTTP 与 TCP 健康检查,及时发现接口不可用或依赖端口宕机。
  • 根据接口响应波动设置动态阈值告警,减少短暂抖动触发的误报。
  • 定时读取应用日志文件,识别重复报错和异常模式并生成巡检报告。
  • 对核心域名和数据库端口做 Ping/TCP 巡检,产出可归档的稳定性报告。

适合人员

  • 负责线上服务稳定性的运维工程师,需要为接口、端口和日志配置持续检查与告警。
  • 管理小型站点的 SRE,需要减少固定阈值误报并生成定时巡检报告。
  • 排查应用异常的工程师,需要从日志文件中发现重复错误和异常模式。
  • 做交付验收的工程师,需要把 HTTP/TCP/Ping 检查结果整理成报告。