Agent Skills
返回列表
📁

PDF 工具包

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/pdf-zh。

技能介绍

解决什么问题

当 PDF 需要进入自动化流程时,常见问题不是“打开文档”,而是如何可靠地取出文本和表格、把多个 PDF 合并或拆分、生成新的 PDF,以及处理表单字段。PDF 工具包 面向这类编程式文档处理任务,提供从 Python 库到命令行工具的选型路径。它把常见 PDF 操作整理成可执行的工具链,便于在数据清洗、报告生成、合同整理等场景中复用。

如何工作

  • 用 pypdf 处理基础操作:合并、拆分、元数据读取、页面旋转。
  • 用 pdfplumber 提取带布局的文本和表格,适合把 PDF 内容转成结构化数据。
  • 用 reportlab 的 Canvas 或 Platypus 创建 PDF,包括多页文档生成。
  • 用 pdftotext、qpdf、pdftk 等命令行工具完成快速合并、转换或批处理。
  • 表单填写可结合 pdf-lib 或 pypdf,按 forms.md 的说明处理字段映射和写入。
  • 对复杂流程,可参考 reference.md 中的 pypdfium2、JavaScript 库与故障排查内容。

适用边界

该技能适合在脚本或工作流中完成可重复的 PDF 操作。若任务涉及扫描版 OCR,通常先用图像识别工具转成文本;若重点是高级渲染、复杂版面理解或表单交互,应优先查看对应参考文档,而不是只依赖基础合并/拆分能力。

使用场景

  • 处理合同批次时,用 `qpdf` 或 `pypdf` 将多份 PDF 合并、按页拆分并归档。
  • 分析研报 PDF 时,用 `pdfplumber` 提取文本和表格,再清洗成结构化数据。
  • 生成绩效报告时,用 `reportlab` 的 `Canvas` 或 `Platypus` 输出多页 PDF。
  • 整理扫描版材料时,结合 `pytesseract` 先把图像内容转成可检索文本。

适合人员

  • 后端工程师:把 PDF 解析、拆分、表单填写接入自动化流水线。
  • 数据分析师:从研报和财报 PDF 中提取文本与表格,做后续清洗。
  • 报告开发者:用 `reportlab` 程序化生成多页 PDF 报告。
  • DevOps 工程师:用 `qpdf`、`pdftotext` 做命令行批处理。