TencentOS 内核宕机分析专家
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_7ac3e421/tencentos-crash-expert。
技能介绍
解决什么问题
Linux 内核宕机(vmcore)分析通常依赖人工执行 crash 命令,存在两个痛点:一是全局状态与局部调用栈容易混淆,导致“锚定偏差”;二是排查修复补丁与评估缓解措施时,缺乏结构化的验证链路,容易给出未经交叉验证的无效建议。本技能将分析过程拆解为 7 个严格受控的阶段,强制要求“证据驱动”与“因果验证”。
核心能力与关键步骤
技能通过 AiCrasher MCP 工具实现自动化 crash 调试,核心工作流包括:
- 全局扫描优先:在 Soft/Hard Lockup 场景中,强制先统计全局 CPU 状态(
bt -a),避免将 Panic CPU 的局部快照误判为根因。 - 根因分类路由:分析完成后强制输出“内核缺陷”或“非内核缺陷”判定。若为内核缺陷,则进入阶段四搜索上游
fix commit及发行版修复状态;若为业务配置或用户态问题,则直接跳过补丁搜索,避免无效检索。 - 参数与单位交叉验证:内置严格的防错机制,例如强制校验
ps命令输出的RSS单位(KB 而非 pages),以及要求通过源码、反汇编和结构体偏移量三步验证sysctl参数的实际运行时值。 - 标准化报告:最终通过
crash_report_generator.py脚本,将分析结论与crash命令日志(@cmd[]引用)渲染为中文 HTML 报告,并自动释放 MCP 会话资源。
适用边界与注意点
- 环境依赖:强烈依赖
AiCrasher MCP Server的注册与会话启动,首次注册后需重启会话才能热加载。 - 源码与反汇编:进行
sysctl参数排查或补丁验证时,必须提供匹配版本的kernel-debuginfo或内核源码git仓库,仅靠sym命令无法定位per-netns结构体字段。 - 长对话防遗忘:技能内置“阶段切换铁律”,要求在进入每个新阶段前主动重新读取对应的
phase*.md步骤文件,以防止长对话中早期指令被稀释。
使用场景
- 生产服务器发生 soft lockup 并落盘 vmcore,需要判断 panic CPU 快照是否只是局部现象。
- 拿到 OOM 宕机 dump,需要确认是内核内存泄漏还是业务配置导致不可杀进程。
- 已有内核源码仓库,需要查找上游修复 commit 并确认发行版哪个 tag 已包含修复。
- 分析完 NULL 指针解引用后,需要给出可验证的 sysctl 缓解建议并生成 HTML 报告。
适合人员
- 负责生产 Linux 服务器宕机复盘的运维工程师,需要把 vmcore 证据整理成可交付的根因报告。
- 处理内核 crash 工单的基础设施工程师,需要区分内核缺陷、业务配置和用户态触发条件。
- 维护发行版内核补丁的工程师,需要在本地 git 仓库确认修复 commit、tag 和反汇编证据。
- 做安全与可用性排障的 SRE,需要基于 vmcore 评估缓解参数是否具备因果有效性。