PDF 智能处理套件
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_9ebebf30/calenderv2222。
技能介绍
问题场景
PDF 在自动化流程里常是信息孤岛:正文可能是流式文本,也可能是扫描图;表格需要结构化成 CSV 或 Excel;文件还需要合并、拆分、加水印、改元数据。手工处理成本高,且容易把版式、页码和权限信息弄丢。
能力与工作方式
该技能围绕 PDF 解析与输出组织:
- 文本提取:使用
pdfplumber获取纯文本或带位置信息的结构化文本,便于定位字段。 - 表格识别:结合
camelot-py与pdfplumber,将 PDF 表格提取为结构化数据,输出CSV/Excel更友好。 - OCR 识别:通过
pytesseract处理扫描件和图片型 PDF,支持多语言文字抽取。 - 格式转换:借助
pdf2image将 PDF 转图片,并面向 Word、Excel 等下游处理链路提供中间结果。 - 页面与安全:用
PyPDF2完成合并、拆分、旋转、删除、加密、解密,也可添加水印或数字签名。 - 元数据:读取和修改文档属性,方便归档与追溯。
边界与注意
OCR 需要外部 Tesseract 环境;复杂版式、跨页表格、加密文件或低质量扫描件仍可能影响识别精度。数字签名与加密属于文档安全操作,执行前应明确文件所有权和权限要求。
使用场景
- 处理采购合同扫描件时,先做 OCR 抽取关键条款,再合并成一份可检索 PDF。
- 整理供应商报价 PDF 时,用表格识别把价格表导出为 CSV,便于进入 Excel 对账。
- 归档财务月报前,批量删除草稿页、旋转横版页面,并添加保密水印。
- 读取投标文档元数据并修改作者、标题和创建日期,避免归档信息不一致。
适合人员
- 负责合同归档的法务助理,需要从扫描件中提取条款并添加保密水印。
- 做供应商对账的财务分析师,要把 PDF 报价表识别成 CSV 或 Excel。
- 维护文档库的办公自动化工程师,需要合并、拆分、加密和修改 PDF 元数据。
- 处理多语言扫描件的海外业务运营,需要用 OCR 抽取文本进入后续翻译。