Agent Skills
返回列表
PDF 智能处理套件

PDF 智能处理套件

办公效率 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_9ebebf30/calenderv2222。

技能介绍

问题场景

PDF 在自动化流程里常是信息孤岛:正文可能是流式文本,也可能是扫描图;表格需要结构化成 CSV 或 Excel;文件还需要合并、拆分、加水印、改元数据。手工处理成本高,且容易把版式、页码和权限信息弄丢。

能力与工作方式

该技能围绕 PDF 解析与输出组织:

  • 文本提取:使用 pdfplumber 获取纯文本或带位置信息的结构化文本,便于定位字段。
  • 表格识别:结合 camelot-py 与 pdfplumber,将 PDF 表格提取为结构化数据,输出 CSV / Excel 更友好。
  • OCR 识别:通过 pytesseract 处理扫描件和图片型 PDF,支持多语言文字抽取。
  • 格式转换:借助 pdf2image 将 PDF 转图片,并面向 Word、Excel 等下游处理链路提供中间结果。
  • 页面与安全:用 PyPDF2 完成合并、拆分、旋转、删除、加密、解密,也可添加水印或数字签名。
  • 元数据:读取和修改文档属性,方便归档与追溯。

边界与注意

OCR 需要外部 Tesseract 环境;复杂版式、跨页表格、加密文件或低质量扫描件仍可能影响识别精度。数字签名与加密属于文档安全操作,执行前应明确文件所有权和权限要求。

使用场景

  • 处理采购合同扫描件时,先做 OCR 抽取关键条款,再合并成一份可检索 PDF。
  • 整理供应商报价 PDF 时,用表格识别把价格表导出为 CSV,便于进入 Excel 对账。
  • 归档财务月报前,批量删除草稿页、旋转横版页面,并添加保密水印。
  • 读取投标文档元数据并修改作者、标题和创建日期,避免归档信息不一致。

适合人员

  • 负责合同归档的法务助理,需要从扫描件中提取条款并添加保密水印。
  • 做供应商对账的财务分析师,要把 PDF 报价表识别成 CSV 或 Excel。
  • 维护文档库的办公自动化工程师,需要合并、拆分、加密和修改 PDF 元数据。
  • 处理多语言扫描件的海外业务运营,需要用 OCR 抽取文本进入后续翻译。