PNG/PDF 处理指南
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-pngpdf。
技能介绍
面向 PDF 日常工程处理
场景:把图片拼成 PDF、合并拆分文档、抽取文本表格、加水印加密。传统做法常在 pypdf、pdfplumber、reportlab 和 CLI 工具间切换。该技能提供统一指南,列出任务和最佳工具,避免反复查 API。
工作方式与关键步骤
- 基础操作:用
pypdf合并、拆分、旋转页面、读取元数据。 - 内容提取:用
pdfplumber做extract_text()和extract_tables(),适合文本型 PDF 的布局与表格。 - 创建与转换:用
reportlab从图片生成高质量单页或多页 PDF,支持Canvas/Platypus。 - 命令行:用
qpdf、pdftotext、pdftk处理合并、提取和批处理。 - 进阶任务:扫描件先转图片再 OCR,表单填写参考
forms.md,复杂用法参考reference.md。
适用边界
资料偏工程指南,不自动替代完整 OCR 引擎或 PDF 表单服务;密码保护、水印、图片抽取依赖目标库和权限。需要复杂 JavaScript、高级 pypdfium2 或表单规则时应阅读补充文档。
使用场景
- 后端开发把多份导出报表 PDF 按顺序合并、拆分单页,并给归档文件加水印。
- 数据工程师从合同和发票 PDF 中抽取文本与表格,用于结构化校验与对账。
- 文档自动化用 Python 将巡检照片批量生成多页高质量 PDF,避免手动排版。
- 测试工程师在 CI 中用 `qpdf`、`pdftotext` 合并 PDF、抽取文本并做回归校验。
适合人员
- 负责财务报销或合同归档的 Python 工程师,需要批量合并、拆分、加密 PDF。
- 做报表自动化的数据工程师,需要从 PDF 中抽取文本和表格字段。
- 编写文档工具链的后端开发者,需要把截图或照片生成多页 PDF。
- 维护 CI 脚本的测试工程师,需要用命令行工具校验生成 PDF 的内容。