Agent Skills
返回列表
PDF字段提取器

PDF字段提取器

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_26bdbd50/pdf-field-extractor。

技能介绍

解决的问题

很多办公 PDF 的结构化信息藏在版式、表格和扫描件里:发票金额、合同条款、营业执照字段、银行对账单余额等,靠人工誊抄容易漏字段。Pdf Field Extractor 面向这类场景,把文档中的关键信息抽取成机器可读的 Excel / JSON,便于后续对账、归档或系统导入。

工作方式

  • 先定位内容:使用 PyMuPDF 与 pdfplumber 提取文本和表格;对无文本层的扫描件自动触发 pytesseract OCR,支持中英日韩等语言。
  • 再识别文档类型:根据关键词与 AI 判断,区分为发票、合同、收据、营业执照、银行对账单、快递单或通用文档。
  • 最后结构化输出:调用 OpenAI 兼容接口完成字段抽取,一行一条记录生成 .xlsx,也可输出嵌套 JSON;批量处理时会合并结果。

适用边界

  • 需要用户自行配置大模型 API Key,Skill 侧不存储密钥。
  • 扫描件识别率依赖图片清晰度,建议保持足够分辨率并做去噪增强。
  • 更适合发票、合同、收据等字段较固定的文档;完全自由文本的抽取质量取决于模型与提示词。

使用场景

  • 财务收到一批 PDF 发票,需要提取发票号、日期、金额、买卖双方并汇总到 Excel。
  • 法务审阅合同 PDF,需要把签订方、金额、期限、违约条款等关键字段抽成 JSON 供系统导入。
  • 运营整理 PDF 快递单和收据,需要批量识别单号、收寄件人、金额并生成表格。
  • 数据分析师处理 PDF 银行对账单,需要提取日期、交易摘要、借贷金额并输出结构化 JSON。

适合人员

  • 财务:每月核对多张 PDF 发票,要求把票据字段快速抽成 Excel 便于报销和对账。
  • 法务助理:处理合同 PDF,需要提取关键条款并整理成 JSON 供审批系统读取。
  • 电商运营:批量整理 PDF 快递单和收据,需要统一字段并生成可筛选表格。
  • 数据分析师:清洗 PDF 银行对账单,需要输出结构化 JSON 接入报表流程。