PDF 工具包
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/pdf-zh。
技能介绍
解决什么问题
当 PDF 需要进入自动化流程时,常见问题不是“打开文档”,而是如何可靠地取出文本和表格、把多个 PDF 合并或拆分、生成新的 PDF,以及处理表单字段。PDF 工具包 面向这类编程式文档处理任务,提供从 Python 库到命令行工具的选型路径。它把常见 PDF 操作整理成可执行的工具链,便于在数据清洗、报告生成、合同整理等场景中复用。
如何工作
- 用
pypdf处理基础操作:合并、拆分、元数据读取、页面旋转。 - 用
pdfplumber提取带布局的文本和表格,适合把 PDF 内容转成结构化数据。 - 用
reportlab的Canvas或Platypus创建 PDF,包括多页文档生成。 - 用
pdftotext、qpdf、pdftk等命令行工具完成快速合并、转换或批处理。 - 表单填写可结合
pdf-lib或pypdf,按forms.md的说明处理字段映射和写入。 - 对复杂流程,可参考
reference.md中的pypdfium2、JavaScript 库与故障排查内容。
适用边界
该技能适合在脚本或工作流中完成可重复的 PDF 操作。若任务涉及扫描版 OCR,通常先用图像识别工具转成文本;若重点是高级渲染、复杂版面理解或表单交互,应优先查看对应参考文档,而不是只依赖基础合并/拆分能力。
使用场景
- 处理合同批次时,用 `qpdf` 或 `pypdf` 将多份 PDF 合并、按页拆分并归档。
- 分析研报 PDF 时,用 `pdfplumber` 提取文本和表格,再清洗成结构化数据。
- 生成绩效报告时,用 `reportlab` 的 `Canvas` 或 `Platypus` 输出多页 PDF。
- 整理扫描版材料时,结合 `pytesseract` 先把图像内容转成可检索文本。
适合人员
- 后端工程师:把 PDF 解析、拆分、表单填写接入自动化流水线。
- 数据分析师:从研报和财报 PDF 中提取文本与表格,做后续清洗。
- 报告开发者:用 `reportlab` 程序化生成多页 PDF 报告。
- DevOps 工程师:用 `qpdf`、`pdftotext` 做命令行批处理。