PDF 万能大师
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e867e415/pdf-master 到你的 AI 助手中。
技能介绍
要解决的问题
处理 PDF 时,常见问题不是“能不能改”,而是不知道文件处于什么状态:加密、扫描、文本层缺失、页面混合,都会导致提取、合并、压缩、脱敏等步骤静默失败。该技能把这些问题前置成检测与路由,避免直接猜测执行。
工作方式
- 先检测后处理:通过
pdf_info.py读取页数、大小、加密状态、文本层、扫描件占比和元数据。 - 按类型路由:文本层走
PyMuPDF/pdfplumber;纯图像走 OCR;混合页面分路处理;加密文件要求密码或终止。 - 意图拆分:复合指令会拆成能力链,例如重命名、合并、生成目录,并按依赖顺序执行。
- 高风险确认:批量任务、不可逆操作、参数缺失时先展示清单、差异或默认值。
- 交付质检:结果文件之外,附验收结论、失败降级和安全说明,发票验真与电子签名在外部接口不可用时明确标注限制。
适用边界
适合需要可控流程的 PDF 编辑、整理、提取与脱敏任务。若文件涉密,必须遵循本地处理限制;“涂黑/打码”与“永久删除”是不同操作,不能混用。外部依赖不可用时,不得伪造验真或有效签名结果。
使用场景
- 接手一批客户合同后,需要判断加密、扫描件和文本层,再决定提取或 OCR 流程。
- 收到多个带日期命名的 PDF,需要按规则批量重命名后再合并成一份手册。
- 导出财务报表前,要对敏感字段做可恢复打码,并保留差异确认与验证报告。
- 客户发票需要验真,外部接口不可用时明确标注未验真,而不是直接交付。
适合人员
- 处理合同与单据的文档工程师:需要先识别 PDF 状态,再选择文本提取、OCR 或安全处理。
- 维护资料库的产品运营:需要批量重命名、合并 PDF,并对不可逆操作留确认记录。
- 审核财务或法务材料的合规人员:需要可恢复打码、验证脱敏结果并出具说明。
- 接入内部流程的后端工程师:需要脚本化检测 PDF 元数据、路由失败降级和交付质检。