Agent Skills
返回列表
PDF 处理指南

PDF 处理指南

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f39a06e7/docx12345544。

技能介绍

解决的问题

PDF 文件在办公自动化中经常以非结构化形式存在:合并、拆分、提取文本或表格、生成简单报告、加水印和保护文件,都不适合靠人工操作或单一 GUI 完成。该技能面向工程师提供一套基于 Python 和命令行的 PDF 处理路径,重点解决脚本化、可重复执行的日常文档任务。

工作方式

  • 基础文档操作:使用 pypdf 完成合并、拆分、提取元数据、旋转页面等任务。
  • 内容提取:使用 pdfplumber 提取带布局的文本和表格,适合把 PDF 中的信息转成结构化数据。
  • 文档创建:使用 reportlab 的 Canvas 或 Platypus 生成单页或多页 PDF。
  • 命令行补充:通过 pdftotext、qpdf 等工具处理文本转换、合并等批量操作。
  • 扫描件与常见任务:将扫描件转为图像后使用 pytesseract 做 OCR,并覆盖水印、密码保护等场景。
  • 表单与进阶:PDF 表单填写需遵循 forms.md,JavaScript 库、详细示例和排障内容放在 reference.md。

适用边界

该技能适合自动化脚本、办公文档批处理和简单 PDF 生成,不替代专业排版工具,也不保证复杂版面识别效果。涉及表单、高级 pypdfium2 或 pdf-lib 用法时,应按资料中的对应文档执行。

使用场景

  • 把一批月度 PDF 报告逐份拆分,并按页码生成独立文件归档。
  • 从带表格的 PDF 合同或报表中提取文本与表格,准备录入系统。
  • 用 reportlab 根据固定模板批量生成多页 PDF 交付文件。
  • 将扫描件 PDF 转成图像后运行 OCR,得到可搜索文本。

适合人员

  • 写自动化脚本的后端工程师:需要稳定合并、拆分和提取 PDF 元数据。
  • 处理合同和报表的数据分析:需要从 PDF 表格中拿到结构化数据。
  • 生成交付文档的运营工程:需要批量创建带多页内容的 PDF。
  • 处理扫描件的技术支持:需要把扫描 PDF 转图像并做 OCR。