Agent Skills
返回列表
PDF 办公处理指南

PDF 办公处理指南

办公效率 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f39a06e7/pdf-official123。

技能介绍

解决什么问题

PDF 自动化中常见的卡点,不只是把文件合并或拆分:文本型 PDF 的文字提取、表格解析,扫描型 PDF 的 OCR,以及生成简单 PDF、加水印、设置密码等都需要分别选型。pdf-official2 把这些常见操作按工具和用途拆成可直接套用的路径,避免在多个库里盲目试错。

技能如何工作

该技能以 Python 库 和 命令行工具 两条线组织内容:

  • pypdf 用于合并、拆分、提取元数据、旋转页面等基础操作;
  • pdfplumber 用于保留版式的文本提取与表格提取;
  • reportlab 用于从零生成单页或多页 PDF;
  • qpdf、pdftotext、pdftk 用于快速合并、转文本或处理页面;
  • 扫描件通常先转成图像,再交给 pytesseract 做 OCR。

关键步骤是先判断 PDF 类型:文本型优先用 pdfplumber;扫描型先做图像处理;生成报告则用 reportlab 的 Canvas 或 Platypus。

适用边界

它适合脚本化、重复性 PDF 处理,不适合替代专业排版软件或复杂文档流设计。若涉及 PDF 表单,资料指向 forms.md,需要按表单字段结构填写;高级用法和故障排查在 reference.md。实际可用性依赖本地安装的 Python 包与系统工具,输出质量也会受原 PDF 结构、表格边框和扫描清晰度影响。

使用场景

  • 把一批合同 PDF 按页数拆分,并为每份文件补充页码与元数据。
  • 从财报 PDF 中提取文字和表格,输出 CSV 供后续分析。
  • 将多份项目说明合并成一个 PDF,并加上公司水印和访问密码。
  • 把扫描件先转图,再用 OCR 提取正文,整理成可搜索文档。

适合人员

  • 需要把发票、合同、报告批量拆分合并的行政或财务专员
  • 要把 PDF 报表文本和表格抽成结构化数据的分析师
  • 需要用 Python 生成简单产品说明 PDF 的产品运营
  • 要把扫描合同转成可搜索文本并加水印的法务助理