PDF 全能编辑器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_09701b7c/mainpdf。
技能介绍
解决的问题
PDF 处理经常被拆成多个工具:提取文字、识别扫描件、修表格、插图、转 Word、合并页面往往各自依赖不同库。PDF EDITOR 把这条链路收敛为一个本地脚本入口,适合在终端或 Agent 里连续完成读取、编辑、转换和总结。
核心能力与步骤
- 提取:优先用
PyMuPDF/pdfplumber获取文字、表格和图片。 - OCR 回退:当 PDF 没有文字层时,调用
pytesseract或easyocr识别。 - 编辑:通过
insert_textbox、insert_image、页面删除、旋转、合并拆分修改内容。 - 转换:支持 PDF 转 Word、图片、HTML、纯文本,以及图片合成 PDF。
- 文档分析:可归纳要点,也可查看页数、尺寸等元信息。
边界与注意
- 扫描件转 Word 会采用图片嵌入模式,结果更像可打印页面,不保证文字可编辑。
- 无边框复杂表格可能需要调整
pdfplumber检测参数。 EasyOCR更适合中文和手写,但 Windows 下可能遇到No module named 'pwd'。- 输出路径默认在
output/,执行结束后会打印绝对路径。
使用场景
- 收到扫描件合同,先 OCR 提取正文,再定位二维码并替换为新链接。
- 把多份 PDF 按页拆分,删除空白页并合并成一份送审文件。
- 把 PDF 中表格提取成可编辑数据,再转成 Word 给业务同事修改。
- 处理长报告时先总结要点,再导出指定页为图片用于邮件说明。
适合人员
- 负责整理扫描件合同和审批页的文档工程师,需要 OCR、替换二维码和合并分页。
- 经常把 PDF 报告转成 Word 或图片给非技术人员修改的运营。
- 需要提取 PDF 表格和图片并做归档校验的数据或 QA 人员。
- 希望本地处理敏感 PDF、避免上传第三方云的独立开发者。