PDF 智能处理套件
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_9ebebf30/xxxxxtstslug。
技能介绍
解决什么问题
PDF 常把正文、表格、扫描件混在一起,普通文本提取容易丢失坐标和结构,直接给人看又难以继续处理。这个技能面向需要把 PDF 转成可编辑、可检索、可计算数据的场景,尤其适合合同、报表、扫描件等文档。
能力与工作方式
它把常见 PDF 处理任务拆成一组工具:文本提取 获取纯文本或带布局的结构化文本;表格识别 将表格转为 CSV/Excel;OCR 处理扫描页和图片型页面;格式转换 支持 PDF 到 Word、Excel、图片;页面操作 覆盖合并、拆分、旋转、删除;安全处理 包括加密、解密、水印和签名;元数据管理 可读改属性。
实现上依赖多个 Python 库:PyPDF2 负责基础页面与安全操作,pdfplumber 和 camelot-py 做文本与表格定位,pytesseract 做 OCR,pdf2image 负责转图,reportlab 与 Pillow 支持生成和图像处理。典型流程是先判断 PDF 是文本型、表格型还是扫描型,再选择提取、OCR 或转换路径,最后输出结构化结果。
适用边界
该技能侧重文档处理,不适合需要法律级签名验证、复杂版式还原或大规模生产流水线调优的场景。OCR 效果依赖 Tesseract 安装、语言包和图像质量;表格识别在跨页、合并单元格、复杂线条中可能不稳定。涉及敏感文档时,应确认加密、签名和水印流程是否符合内部合规要求。
使用场景
- 收到多页 PDF 合同,需要按页拆分、删除无关页,并加密后存档。
- 扫描版英文报表无法复制,需要 OCR 识别文字并导出成可编辑文本。
- 把 PDF 中多个供应商报价表提取成 CSV,便于在 Excel 里比价。
- 将 PDF 报告转成 Word 和图片,分别用于修订和归档展示。
适合人员
- 处理合同和报表的运营专员,需要拆分 PDF 页面并加密存档。
- 整理招标资料的行政人员,需要把扫描文件 OCR 成可编辑文本。
- 做供应商比价的采购分析师,需要从 PDF 表格提取 CSV 数据。
- 维护文档库的内容工程师,需要批量转换 PDF 为 Word、Excel 和图片。