办公文档处理工作流
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f39a06e7/docx1234。
技能介绍
面向脚本化的 PDF 处理流程
在处理办公文档时,PDF 常出现合并、拆分、提取文本与表格、加水印、保护文件等需求。这个技能把这些操作整理成以 Python 与命令行工具为主的执行路径,避免临时查 API。
核心能力与关键步骤
- 基础文件操作:使用
pypdf合并、拆分、旋转页面、读取和写入元数据。 - 内容提取:用
pdfplumber做带版式的文本提取和表格提取;对扫描版 PDF 先转图像,再走 OCR 路径。 - 生成 PDF:用
reportlab的Canvas或Platypus创建单页和多页文档。 - 命令行辅助:配合
pdftotext、qpdf,必要时用pdftk,适合在流水线中处理批量文件。
技能会按任务选择工具:合并拆页优先 pypdf,文本表格提取优先 pdfplumber,创建新 PDF 用 reportlab,批量命令行处理用 qpdf。
适用边界
它更偏向可脚本化的 PDF 操作,不提供复杂排版设计;填表单、高级 pypdfium2、JavaScript pdf-lib 和排障需要参考后续文档。若源文件是图片型 PDF,应明确 OCR 前置步骤,而不是直接按文本型 PDF 解析。
使用场景
- 把多个季度报告 PDF 合并成一份档案,再按章节拆分成独立文件。
- 从供应商 PDF 报价单里提取表格,并整理成可计算的行列数据。
- 为合同扫描件执行 OCR 文本提取,便于搜索关键条款。
- 在生成的多页 PDF 中加入页眉、页脚和固定水印。
适合人员
- 文档管理员,需要批量合并季度报告并按章节拆分文件。
- 数据分析师,要从 PDF 报价单中提取表格并整理成结构化数据。
- 后端工程师,需要在脚本中编排 pypdf 或 qpdf 处理流水线。
- 法务助理,需要提取扫描件合同文本并定位关键条款。