Agent Skills
返回列表
办公文档处理工作流

办公文档处理工作流

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_f39a06e7/docx1234。

技能介绍

面向脚本化的 PDF 处理流程

在处理办公文档时,PDF 常出现合并、拆分、提取文本与表格、加水印、保护文件等需求。这个技能把这些操作整理成以 Python 与命令行工具为主的执行路径,避免临时查 API。

核心能力与关键步骤

  • 基础文件操作:使用 pypdf 合并、拆分、旋转页面、读取和写入元数据。
  • 内容提取:用 pdfplumber 做带版式的文本提取和表格提取;对扫描版 PDF 先转图像,再走 OCR 路径。
  • 生成 PDF:用 reportlab 的 Canvas 或 Platypus 创建单页和多页文档。
  • 命令行辅助:配合 pdftotext、qpdf,必要时用 pdftk,适合在流水线中处理批量文件。

技能会按任务选择工具:合并拆页优先 pypdf,文本表格提取优先 pdfplumber,创建新 PDF 用 reportlab,批量命令行处理用 qpdf。

适用边界

它更偏向可脚本化的 PDF 操作,不提供复杂排版设计;填表单、高级 pypdfium2、JavaScript pdf-lib 和排障需要参考后续文档。若源文件是图片型 PDF,应明确 OCR 前置步骤,而不是直接按文本型 PDF 解析。

使用场景

  • 把多个季度报告 PDF 合并成一份档案,再按章节拆分成独立文件。
  • 从供应商 PDF 报价单里提取表格,并整理成可计算的行列数据。
  • 为合同扫描件执行 OCR 文本提取,便于搜索关键条款。
  • 在生成的多页 PDF 中加入页眉、页脚和固定水印。

适合人员

  • 文档管理员,需要批量合并季度报告并按章节拆分文件。
  • 数据分析师,要从 PDF 报价单中提取表格并整理成结构化数据。
  • 后端工程师,需要在脚本中编排 pypdf 或 qpdf 处理流水线。
  • 法务助理,需要提取扫描件合同文本并定位关键条款。