Agent Skills
返回列表
红狐数据 PDF 和图片文字提取

红狐数据 PDF 和图片文字提取

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @redfox-data/pdf-image-text-extractor-redfox。

技能介绍

要解决的问题

文档里的文字常常以截图、聊天记录图片、扫描件或复杂 PDF 形式存在,直接复制不可用,也不方便进入后续整理、检索或知识库流程。工程师需要把图片中的标题、正文、注释、水印,以及 PDF 中的段落和标题层级转成可编辑的 Markdown 文本,减少手工转录。

工作方式

该技能面向图片与 PDF 的文字提取任务。图片侧通过 read_image 识别内容,并在提示中要求提取标题、正文、注释、水印等文字;PDF 侧调用 scripts/pdf_text_extractor.py 按页提取文本,尽量保留段落和标题层级。最终可按需直接输出文字,或生成 .md 文件,包含来源、提取状态和正文内容。对于扫描页面,会提示可能无法直接提取,并建议改用 OCR。

适用边界

文字清晰度、字体、背景会影响识别结果;表格、多栏、扫描版页面可能提取不全或为空。加密或密码保护的 PDF 不支持,建议文件小于 50MB,敏感内容仅在当前会话内处理。复杂表格或多栏版式建议人工复核。

使用场景

  • 整理聊天截图里的订单备注时,需要把图片中标题、正文和备注转成 Markdown 文本。
  • 归档旧 PDF 协议时,需要提取每页正文并保留标题层级,生成 .md 文件供检索。
  • 核对报表截图中的指标名称与数值时,需要快速识别图中文字并整理成易读列表。
  • 处理扫描版 PDF 时,需要判断哪些页面无法直接提取,并得到 OCR 处理提示。

适合人员

  • 负责客服工单归档的工程师,需要把用户提供的截图备注转成可编辑文本。
  • 维护知识库的文档工程师,需要把旧 PDF 说明转成 Markdown 以便检索和引用。
  • 做数据核对的分析师,需要识别报表截图中的指标名、数值和注释。
  • 处理合同扫描件的法务助理,需要知道哪些 PDF 页面无法直接提取并需 OCR。