PDF 处理指南
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3b701cc1/pdf-hyl。
技能介绍
要解决的问题
处理 PDF 时,需求经常散落在不同工具里:pypdf 适合合并、拆分、读取元数据、旋转页面;pdfplumber 适合提取带布局的文本和表格;reportlab 适合从空白处生成 PDF;扫描件还要先转成图像再做 OCR;表单填写也有单独说明。这个技能的价值,是把“该用哪个库、先做哪一步”整理成一张任务路径,减少在多个文档之间反复确认。
核心能力与步骤
- 基础结构操作:用
pypdf合并多个 PDF、按页拆分、提取文档元数据、旋转指定页面,适合处理归档、拆分单页文件、整理页面方向。 - 文本与表格提取:用
pdfplumber提取保留版面信息的文本和表格,适合从报告、发票、清单、数据表中抓取可进一步处理的文本。 - PDF 生成:用
reportlab的Canvas或Platypus创建单页或多页 PDF,适合生成简单报告、说明文档、测试文件。 - 命令行补充:用
pdftotext做快速文本转换,用qpdf完成合并、拆分等结构操作,适合脚本化和批量处理。 - 进阶任务:扫描 PDF 先转图像再 OCR;水印、图片提取、密码保护按指南处理;表单填写遵循
forms.md,避免误把填写当普通文本替换。
适用边界
这份资料偏工程操作指南,不是 OCR 算法、版面重建或复杂业务表单的自动识别方案。对于 JavaScript pdf-lib、pypdfium2 高级用法、异常排查和更细示例,应继续查看 reference.md。
使用场景
- 收到拆成多页的发票 PDF,要把每页保存成独立文件归档。
- 从报价单 PDF 中提取带版面的文本和表格,便于后续核对数据。
- 用 reportlab 生成多页说明文档,作为测试或交付的基础 PDF。
- 处理扫描合同 PDF,先转图像再做 OCR,提取可搜索文本。
适合人员
- 维护脚本的 Python 工程师:需要在代码里合并、拆分 PDF 并读取元数据。
- 做数据整理的分析师:要从 PDF 表格抽取结构化文本用于核对。
- 写自动化流程的后端工程师:要用 qpdf、pdftotext 批量处理文档。
- 制作报告的工具链工程师:需用 reportlab 输出多页 PDF。