日志清洗工具箱
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-clean-log-toolkit。
技能介绍
问题
日志排查常常卡在格式:apache、nginx、syslog、JSONL 混在一起,真正有价值的信息散落在重复的超时、连接失败和路径里。直接 grep 容易漏掉上下文,手工聚合又容易把同一类错误拆成很多行。clean-log-toolkit 处理的是这类本地、半结构化日志:先识别格式,再提取时间、级别和消息,最后产出可贴进工单的摘要。
工作
它只提供 Python 3 标准库脚本,不依赖 pip、远程 API 或 shell。parse.py 通过前 50 行嗅探常见格式,并输出 CSV、TSV 或 JSONL;errors.py 会把数字、UUID、十六进制、文件行号和内嵌时间戳归一成指纹,将相似错误聚成 Top-N 组;grep.py 支持正则、否定正则、级别、时间范围和上下文行;follow.py 可像 tail -F 一样跟踪新增日志,并处理轮转。脚本路径有严格白名单校验,默认 UTF-8 读取并回退编码,输出保持 UTF-8。
边界
它不做语义分析,不调用大模型,也不跨目录写入。正则解析偏实用,不是严格语法检查;指纹聚合是启发式,可能把仅凭数字或哈希不同的语义不同错误合并。适合快速整理日志、聚合错误、生成报告前处理,不适合替代完整可观测性平台。
使用场景
- 收到 nginx 访问日志后,用 parse.py 识别格式并导出 JSONL 供后续分析。
- 排查服务异常时,用 errors.py 聚合 WARN/ERROR/FATAL 并输出 Top-N 指纹报告。
- 过滤指定时间段和级别的日志,用 grep.py 提取上下文定位请求失败原因。
- 在 CI 中跟踪增量日志,用 follow.py 按正则和级别捕获异常事件后退出。
适合人员
- 需要把客户发来的多种访问日志整理成可贴进工单摘要的 SRE。
- 要在 CI 里实时捕获新增错误并生成简短诊断的运维工程师。
- 希望避免额外依赖、用 Python 标准库处理日志的后端开发者。
- 需要将重复错误聚成指纹并输出报告的应用开发工程师。