Agent Skills
返回列表
PDF 处理指南

PDF 处理指南

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3b701cc1/pdf-hyl。

技能介绍

要解决的问题

处理 PDF 时,需求经常散落在不同工具里:pypdf 适合合并、拆分、读取元数据、旋转页面;pdfplumber 适合提取带布局的文本和表格;reportlab 适合从空白处生成 PDF;扫描件还要先转成图像再做 OCR;表单填写也有单独说明。这个技能的价值,是把“该用哪个库、先做哪一步”整理成一张任务路径,减少在多个文档之间反复确认。

核心能力与步骤

  • 基础结构操作:用 pypdf 合并多个 PDF、按页拆分、提取文档元数据、旋转指定页面,适合处理归档、拆分单页文件、整理页面方向。
  • 文本与表格提取:用 pdfplumber 提取保留版面信息的文本和表格,适合从报告、发票、清单、数据表中抓取可进一步处理的文本。
  • PDF 生成:用 reportlab 的 Canvas 或 Platypus 创建单页或多页 PDF,适合生成简单报告、说明文档、测试文件。
  • 命令行补充:用 pdftotext 做快速文本转换,用 qpdf 完成合并、拆分等结构操作,适合脚本化和批量处理。
  • 进阶任务:扫描 PDF 先转图像再 OCR;水印、图片提取、密码保护按指南处理;表单填写遵循 forms.md,避免误把填写当普通文本替换。

适用边界

这份资料偏工程操作指南,不是 OCR 算法、版面重建或复杂业务表单的自动识别方案。对于 JavaScript pdf-lib、pypdfium2 高级用法、异常排查和更细示例,应继续查看 reference.md。

使用场景

  • 收到拆成多页的发票 PDF,要把每页保存成独立文件归档。
  • 从报价单 PDF 中提取带版面的文本和表格,便于后续核对数据。
  • 用 reportlab 生成多页说明文档,作为测试或交付的基础 PDF。
  • 处理扫描合同 PDF,先转图像再做 OCR,提取可搜索文本。

适合人员

  • 维护脚本的 Python 工程师:需要在代码里合并、拆分 PDF 并读取元数据。
  • 做数据整理的分析师:要从 PDF 表格抽取结构化文本用于核对。
  • 写自动化流程的后端工程师:要用 qpdf、pdftotext 批量处理文档。
  • 制作报告的工具链工程师:需用 reportlab 输出多页 PDF。