PDF 智能处理套件
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_9ebebf30/filesystem-v2。
技能介绍
要解决的具体问题
PDF 里常混杂文本层、扫描页、复杂表格和页面属性,直接用单一库很难稳定完成任务:有的文档可复制,有的需要 OCR;有的表格带合并单元格,有的只是图片。filesystem-v23 把常见 PDF 处理拆成可组合步骤,围绕提取、转换、页面操作和安全属性做统一封装。
技能如何工作
- 文本提取:用
pdfplumber或PyPDF2读取文本层,支持纯文本或结构化布局。 - 表格识别:结合
pdfplumber与camelot-py,将表格整理为 CSV/Excel 类结构。 - OCR 识别:对扫描件、图片型 PDF 调用
pytesseract做文字识别,依赖本地 Tesseract。 - 格式转换与页面操作:通过
pdf2image、reportlab、Pillow处理 PDF 转图片、生成或编辑。 - 安全与元数据:处理加密、解密、水印、签名和文档属性读写。
适合需要把 PDF 解析结果交给脚本、RAG、表格清洗或自动化流程的场景;对纯图片 PDF 必须先做 OCR,复杂排版表格仍需人工核对。
使用场景
- 处理含扫描页的 PDF 合同,把文字识别为可检索文本后再进入归档系统
- 从采购单 PDF 中识别表格,提取数量、单价并导出 CSV 供脚本核对
- 将多份报告 PDF 拆分、合并并按页码重排,生成待审版本
- 给对外交付的 PDF 添加水印并读取元数据,检查文档属性是否合规
适合人员
- 需要把扫描合同转成可检索文本的档案管理员
- 要从 PDF 单据中提取表格字段做对账的财务分析师
- 要把多页报告拆分合并并加水印的运营支持
- 需要批量处理 PDF 元数据与加密属性的文档工程师