Agent Skills
返回列表
多源数据提取与整理

多源数据提取与整理

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_60000197/data-extraction。

技能介绍

解决什么问题

把分散在图片/扫描件、PDF、Word、Excel/CSV、网页里的文字和表格,转成可归档的 Excel 或 Word 成果物。典型场景是审计底稿、问题清单、整改台账、取证表:来源格式不一,但输出要求固定——表头统一、序号连续、金额大写、缺失值写 —。

技能如何工作

工作流先确认来源和输出形态,再选择提取通道:

  • 图片/扫描件:优先用 Read 工具做多模态读取;批量脚本化时用 scripts/ocr_image.py。
  • PDF / Word:分别用 scripts/pdf_extract.py、scripts/docx_extract.py 提取文本、标题层级与表格。
  • Excel / CSV:用 scripts/excel_clean.py 做 clean、merge、dedupe、split。
  • 网页:用 scripts/web_extract.py 解析 pandas.read_html 可识别的表格,无表格时回退抽取正文列表。

整理阶段按 references/formats.md 规范:日期写 YYYY年MM月DD日,金额同时给出数字与中文大写,表头加粗居中,缺失值统一为 —。最终输出带样式的 .xlsx 或规范 .docx,文件名带日期前缀便于归档。

边界与注意

该技能偏重结构化录入和格式规范化,不是通用爬虫或复杂版式重建。图片表格若排版复杂,直接多模态读取通常比纯 OCR 更稳;easyocr 首次运行会下载中文模型,离线环境应优先使用 Read 通道。网页抓取依赖页面可被 read_html 解析,动态渲染或反爬页面不在稳定能力内。

使用场景

  • 审计人员将多张扫描件中的问题记录提取出来,生成含金额大写与连续序号的 Excel 问题清单。
  • 文档数字化场景:把 PDF 中的表格提取到 Excel,并保留页码和表序号。
  • 台账维护:把多个 Excel/CSV 按表头对齐合并、去重,并按被审计单位拆分。
  • 网页数据录入:从网页表格抓取数据做成表,无表格时抽取正文关键列表。

适合人员

  • 内部审计人员:要从扫描件或 PDF 建立问题清单、整改台账和取证表。
  • 审计助理:要把多份 Excel/CSV 清洗、合并、去重,并拆分成标准台账。
  • 财务或运营人员:要把网页或表格数据整理成金额大写、表头规范的 Excel。
  • 文档数字化负责人:要把 Word、PDF、图片内容整理成可归档的文档或表格。