PDF和图片文字提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5f9c21aa/pdf-image-text-extractor。
技能介绍
解决什么问题
在数字化办公中,从图片或 PDF 文档提取文字是常见需求,但传统方法常面临识别不准、格式丢失等挑战。具体问题包括:
- 扫描版文档转换:需要将图像中的文字准确转换为可编辑文本。
- 复杂内容识别:如发票、名片中的数字和混合文本,易出现混淆。
- 格式保留:保持原有排版、标题层级,便于后续编辑或分析。
技能如何工作
本技能通过自动化流程解决上述问题,核心能力与关键步骤如下:
核心能力:
- 图片文字提取:使用
read_image工具进行全局识别,覆盖标题、正文、注释等。对数字执行二次校验:第一轮全局识别后,第二轮局部放大验证,静默处理易混淆数字(如 6/8/9/0),确保准确性。 - PDF 文字提取:通过
scripts/pdf_text_extractor.py脚本提取文本,保留段落结构和标题层级,输出为 Markdown 格式。 - 多语言支持:识别中英文等多种语言文字。
关键步骤:
- 接收文件:获取上传的图片 URL 或 PDF 路径。
- 执行提取:根据文件类型,调用相应工具或脚本。
- 格式化输出:生成结构化内容,可选生成
.md文件或直接展示。
适用边界与注意点
技能功能有限制,使用时需注意:
- 文件格式:支持图片(PNG、JPG 等)和 PDF(文字版与扫描版),但扫描版可能提取不全。
- 识别准确性:受图像清晰度、字体影响;数字识别遵循“先看形状再判数字”原则,存疑时用 [?] 标注。
- 复杂布局:表格、多栏等布局提取效果可能不佳。
- 隐私与性能:文件仅在当前会话处理,不存储;建议文件小于 50MB 以避免性能问题。
使用场景
- 当需要从多页扫描的PDF合同中提取所有文字,以便进行全文搜索和条款修改时,使用该技能自动生成结构化的Markdown文档。
- 在处理营销活动中的图片素材时,从海报或广告图中识别并提取宣传文案,用于创建文本数据库或翻译准备。
- 接收到客户通过邮件发送的图片格式发票,需要提取发票号码、金额等关键数字信息,以便快速录入财务系统。
- 当归档纸质文档时,将扫描的PDF文件转换为可编辑文本,保留原始段落结构和标题层级,便于后续检索。
适合人员
- 法律文件管理员:负责处理大量扫描合同,需要提取文字进行数字化存储和检索。
- 市场营销专员:从宣传图片中提取文案内容,用于内容管理和跨平台发布。
- 财务助理:处理扫描的财务单据,提取数字数据以加速报销和审计流程。
- 内容策展人:从历史文档图片中提取文字,用于研究或出版目的。