红狐数据 PDF 和图片文字提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @redfox-data/pdf-image-text-extractor-redfox。
技能介绍
要解决的问题
文档里的文字常常以截图、聊天记录图片、扫描件或复杂 PDF 形式存在,直接复制不可用,也不方便进入后续整理、检索或知识库流程。工程师需要把图片中的标题、正文、注释、水印,以及 PDF 中的段落和标题层级转成可编辑的 Markdown 文本,减少手工转录。
工作方式
该技能面向图片与 PDF 的文字提取任务。图片侧通过 read_image 识别内容,并在提示中要求提取标题、正文、注释、水印等文字;PDF 侧调用 scripts/pdf_text_extractor.py 按页提取文本,尽量保留段落和标题层级。最终可按需直接输出文字,或生成 .md 文件,包含来源、提取状态和正文内容。对于扫描页面,会提示可能无法直接提取,并建议改用 OCR。
适用边界
文字清晰度、字体、背景会影响识别结果;表格、多栏、扫描版页面可能提取不全或为空。加密或密码保护的 PDF 不支持,建议文件小于 50MB,敏感内容仅在当前会话内处理。复杂表格或多栏版式建议人工复核。
使用场景
- 整理聊天截图里的订单备注时,需要把图片中标题、正文和备注转成 Markdown 文本。
- 归档旧 PDF 协议时,需要提取每页正文并保留标题层级,生成 .md 文件供检索。
- 核对报表截图中的指标名称与数值时,需要快速识别图中文字并整理成易读列表。
- 处理扫描版 PDF 时,需要判断哪些页面无法直接提取,并得到 OCR 处理提示。
适合人员
- 负责客服工单归档的工程师,需要把用户提供的截图备注转成可编辑文本。
- 维护知识库的文档工程师,需要把旧 PDF 说明转成 Markdown 以便检索和引用。
- 做数据核对的分析师,需要识别报表截图中的指标名、数值和注释。
- 处理合同扫描件的法务助理,需要知道哪些 PDF 页面无法直接提取并需 OCR。