PDF 办公处理指南
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f39a06e7/pdf-official123。
技能介绍
解决什么问题
PDF 自动化中常见的卡点,不只是把文件合并或拆分:文本型 PDF 的文字提取、表格解析,扫描型 PDF 的 OCR,以及生成简单 PDF、加水印、设置密码等都需要分别选型。pdf-official2 把这些常见操作按工具和用途拆成可直接套用的路径,避免在多个库里盲目试错。
技能如何工作
该技能以 Python 库 和 命令行工具 两条线组织内容:
pypdf用于合并、拆分、提取元数据、旋转页面等基础操作;pdfplumber用于保留版式的文本提取与表格提取;reportlab用于从零生成单页或多页 PDF;qpdf、pdftotext、pdftk用于快速合并、转文本或处理页面;- 扫描件通常先转成图像,再交给
pytesseract做 OCR。
关键步骤是先判断 PDF 类型:文本型优先用 pdfplumber;扫描型先做图像处理;生成报告则用 reportlab 的 Canvas 或 Platypus。
适用边界
它适合脚本化、重复性 PDF 处理,不适合替代专业排版软件或复杂文档流设计。若涉及 PDF 表单,资料指向 forms.md,需要按表单字段结构填写;高级用法和故障排查在 reference.md。实际可用性依赖本地安装的 Python 包与系统工具,输出质量也会受原 PDF 结构、表格边框和扫描清晰度影响。
使用场景
- 把一批合同 PDF 按页数拆分,并为每份文件补充页码与元数据。
- 从财报 PDF 中提取文字和表格,输出 CSV 供后续分析。
- 将多份项目说明合并成一个 PDF,并加上公司水印和访问密码。
- 把扫描件先转图,再用 OCR 提取正文,整理成可搜索文档。
适合人员
- 需要把发票、合同、报告批量拆分合并的行政或财务专员
- 要把 PDF 报表文本和表格抽成结构化数据的分析师
- 需要用 Python 生成简单产品说明 PDF 的产品运营
- 要把扫描合同转成可搜索文本并加水印的法务助理