PDF 处理指南
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f39a06e7/docx12345544。
技能介绍
解决的问题
PDF 文件在办公自动化中经常以非结构化形式存在:合并、拆分、提取文本或表格、生成简单报告、加水印和保护文件,都不适合靠人工操作或单一 GUI 完成。该技能面向工程师提供一套基于 Python 和命令行的 PDF 处理路径,重点解决脚本化、可重复执行的日常文档任务。
工作方式
- 基础文档操作:使用
pypdf完成合并、拆分、提取元数据、旋转页面等任务。 - 内容提取:使用
pdfplumber提取带布局的文本和表格,适合把 PDF 中的信息转成结构化数据。 - 文档创建:使用
reportlab的Canvas或Platypus生成单页或多页 PDF。 - 命令行补充:通过
pdftotext、qpdf等工具处理文本转换、合并等批量操作。 - 扫描件与常见任务:将扫描件转为图像后使用
pytesseract做 OCR,并覆盖水印、密码保护等场景。 - 表单与进阶:PDF 表单填写需遵循
forms.md,JavaScript 库、详细示例和排障内容放在reference.md。
适用边界
该技能适合自动化脚本、办公文档批处理和简单 PDF 生成,不替代专业排版工具,也不保证复杂版面识别效果。涉及表单、高级 pypdfium2 或 pdf-lib 用法时,应按资料中的对应文档执行。
使用场景
- 把一批月度 PDF 报告逐份拆分,并按页码生成独立文件归档。
- 从带表格的 PDF 合同或报表中提取文本与表格,准备录入系统。
- 用 reportlab 根据固定模板批量生成多页 PDF 交付文件。
- 将扫描件 PDF 转成图像后运行 OCR,得到可搜索文本。
适合人员
- 写自动化脚本的后端工程师:需要稳定合并、拆分和提取 PDF 元数据。
- 处理合同和报表的数据分析:需要从 PDF 表格中拿到结构化数据。
- 生成交付文档的运营工程:需要批量创建带多页内容的 PDF。
- 处理扫描件的技术支持:需要把扫描 PDF 转图像并做 OCR。