PDF和图片文字提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @laoxi/pdf-tupianwenzitiqu。
技能介绍
要解决的问题
在处理 PDF 和图片文档时,提取文字内容常面临保真度不足的挑战。扫描型 PDF 文本层缺失导致信息丢失;混合 PDF 中文本与图像不一致;多栏、表格等复杂结构在提取后变得混乱;关键数字、金额、编号等高风险内容容易识别错误。传统工具要么忽略文档结构,要么使用一刀切的策略,无法针对不同文档类型和用户意图选择最优路径。
技能如何工作
本技能通过系统化流程解决上述问题,核心能力包括:
- 文件类型诊断:对 PDF 进行页面级分析,计算
text layer信息,将页面归类为native-text、scanned、mixed或suspicious;对图片检查分辨率、方向等特征。 - 识别路径选择:原生 PDF 优先提取文本层;扫描页或图像触发视觉/OCR 路径;混合类型联合处理,对缺失区域补识别。
- 结构恢复:基于坐标、行距、字号等信号恢复阅读顺序,处理标题、列表、表格等结构。例如,多栏页面按“栏→从上到下”顺序阅读;表格先识别表头和行列边界。
- 高风险内容复核:对日期、金额、编号等关键信息进行多轮验证,使用
[?]等标记不确定字符,避免凭常识覆盖视觉证据。
关键步骤为:
- 页面诊断:获取 PDF 页数、元数据,或分析图像质量,分类页面类型。
- 识别执行:按路径提取文字,图像识别时要求按自然阅读顺序输出全部可见内容。
- 结构重建:综合多个特征恢复段落、标题层级和表格布局,避免机械拼接。
- 质量控制:输出前检查页数、阅读顺序、表格对齐等,使用内部状态标记如
OK_NATIVE或LOW_CONFIDENCE。
适用边界与注意点
- 准确性限制:不承诺 100% OCR 正确,重点在于能确认时准确输出,不能确认时明确标记。
- 文档限制:加密、损坏或权限受限的 PDF 无法处理,需用户提供解锁后文件。
- 处理范围:超长 PDF 分批处理,避免上下文过载,优先保证准确率。
- 输出模式:根据用户意图提供保真转写、结构化 Markdown 或数据抽取,文件生成前必须完成校验。
- 质量控制:依赖检查清单(如确认扫描页走视觉路径、表格列无错位),但最终用户应留意异常提示,如“第 7 页表格列界线不清”。
使用场景
- 处理扫描版合同时,需要提取所有文字并保持段落结构,同时对金额和日期字段进行二次复核,确保无识别错误。
- 将混合型 PDF 学术论文(含文本层与扫描图表)转换为结构化 Markdown,以便在笔记软件中编辑和引用。
- 从多张发票图片中提取表格数据,恢复行列关系并验证数字准确性,用于财务系统的批量录入。
- 从身份证或护照图片中提取关键字段(如姓名、编号),标记不确定字符,用于员工档案数字化入库。
适合人员
- 法务专员:需要从扫描的合同 PDF 中提取条款和数字,进行交叉复核以避免法律风险。
- 研究助理:处理扫描版学术文献,将图表和文字整合为可编辑的 Markdown 文档,便于后续分析。
- 会计文员:负责处理大量纸质发票的扫描件,需提取表格中的金额和编号进行对账。
- 人力资源专员:录入员工证件信息时,从图片中提取文字并标记不确定部分,确保数据准确。