Agent Skills
返回列表
TencentOS Server 全栈运维诊断

TencentOS Server 全栈运维诊断

IT 运维与安全 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_8e542df3/123123123。

技能介绍

解决的问题

当 TencentOS Server 出现 CPU 高但热点不明、ping 正常但应用慢、OOM 后无法判断根因、磁盘空间不足或网络吞吐低等现象时,排查通常要在日志、内核、网络栈和性能工具之间反复切换。该技能把分散的运维经验整理成可检索的诊断路径,让工程师从自然语言描述快速定位到相关模块,而不是凭记忆拼接命令。

核心能力与诊断路径

  • 磁盘与存储:覆盖 disk-space、分区、文件系统、LVM 和 SMART 健康检测。
  • 网络:处理连通性、丢包、延迟、conntrack 表满、TCP 重传等场景。
  • 性能与内存:包含 CPU 火焰图、系统调用热点、调度延迟、中断均衡、文件 IO、OOM 与内存泄漏。
  • 系统与安全:覆盖服务状态、时间同步、软件源、等保基线、CVE 查询和 kdump 配置。

技能会先解析意图,再匹配 1~3 个模块,读取对应 references/ 文档后执行只读诊断,并按模块报告格式输出结论。对危险操作如 reboot、mkfs、rm -rf、防火墙清空等,只提供命令文本,不直接执行。

适用边界

它面向 TencentOS 差异,例如 yum/dnf、iptables/firewalld、ss/netstat。性能模块优先使用 perf-prof,不可用时按文档降级。多问题并发时应先聚焦主模块,避免把关联现象直接当根因。

使用场景

  • 排查 TencentOS 服务 CPU 跑满但热点不明,需要生成火焰图定位高耗时调用栈
  • 定位 ping 正常但接口 P99 变慢,需要从网络延迟、系统调用和调度延迟中找出瓶颈
  • 处理进程被 OOM 杀掉后无法判断根因,需要解析 dmesg、cgroup 内存限制和 OOM 指标
  • 完成等保三级安全检查,需要按清单比对 SSH、SELinux、防火墙和密码策略配置

适合人员

  • 负责线上 TencentOS 集群的运维工程师:需要在故障时快速定位磁盘、网络和 CPU 瓶颈
  • 处理 Java/Node 服务异常的 SRE:需要分析火焰图、系统调用毛刺和 OOM 根因
  • 执行安全加固的系统管理员:需要按等保三级清单检查 SSH、防火墙和密码策略
  • 维护内部应用的基础设施工程师:需要排查连接跟踪表满、调度延迟和内存泄漏