运维监控助手
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-ops-maintenance。
技能介绍
问题
运维监控常分散在 SSH、systemctl、docker ps、日志目录和安全检查中。单机能靠手动命令覆盖,多机集群就容易重复劳动:状态采集口径不一致,告警规则散落,Docker 容器和 SSL 证书缺乏持续跟踪,配置文件变更后也难以回溯。
工作方式
技能以 Node.js + TypeScript CLI 为核心,通过 ssh2 建立连接,默认使用白名单只读命令采集 uptime、free、df、ps、systemctl status、docker ps 等状态。核心能力包括:
- 定时巡检:按间隔执行
health、disk、memory、load、cpu、service检查。 - Docker 健康巡检:检查重启超限、OOM Kill、
HEALTHCHECK失败、资源超限和镜像过期。 - SSL 监控:批量检查证书有效期、SAN、TLS 版本,支持 30/7 天告警。
- 安全审计:扫描 SSH、防火墙、文件权限、Docker 安全、内核参数,并给出分级修复建议。
- 日志分析:统计错误趋势、聚合相似模式、识别突增/超时/连续爆发等异常。
- 配置追踪:对
nginx、SSH、sysctl、fstab、hosts、DNS、crontab 建立 SHA256 基线并输出 diff。 - 告警通知:接入飞书、企业微信、邮件、Webhook 和控制台,支持去重、静默、恢复通知和持久化记录。
适用边界
适合 Linux 服务器和 Docker 场景,需要可配置的 SSH 密钥或加密密码。白名单禁止 rm、mv、chmod、systemctl start/stop 等写操作,远程诊断不会直接修改系统;SSL 与网络诊断依赖目标端口可达;集群批量命令受连接池和并发限制,敏感环境应配合审计日志使用。
使用场景
- 多机集群每天要核对磁盘、内存、负载、CPU 和服务状态,并生成统一巡检报告。
- 上线前需要检查多个域名的 SSL 证书有效期、SAN 和 TLS 版本,避免临期才被发现。
- 排查线上错误突增时,要聚合相似日志、识别新模式和超时聚类,并关联多个日志源。
- 安全巡检要核对 SSH 配置、防火墙、文件权限和 Docker 安全项,并输出风险分级建议。
适合人员
- 负责 Linux 服务器和 Docker 集群巡检,需要统一状态采集与告警通知的运维工程师
- 管理多个域名证书,需要在到期前批量检查有效期、SAN 和 TLS 版本的安全工程师
- 排查服务异常,需要从多个日志源聚合错误趋势并识别异常模式的 SRE
- 维护 nginx、SSH 和系统配置,需要基线快照、变更差异和审计记录的配置管理员