Agent Skills
返回列表
LiteParse 本地文档解析专家

LiteParse 本地文档解析专家

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_fb9c3efc/liteparse-anything。

技能介绍

解决什么问题

处理本地文档时,常见需求是把 PDF、Office 文件和图片转成可读取文本,同时避免把文件上传到云端 API。尤其是在离线环境、敏感材料或需要重复批量的场景下,本地解析更可控。该技能基于 LlamaIndex 团队的 LiteParse 开源项目封装,重点解决本地运行、多格式文档解析和低 API 成本的问题。

核心能力与工作方式

该技能围绕 liteparse 提供命令行和 Python 两种调用方式,适合把文档内容提取为文本,再交给后续处理流程。它支持 PDF、Word、Excel、PPT、JPG/PNG 图片、RTF、ODF 等常见格式,底层使用 Rust 实现,并结合 PDFium、Tesseract OCR 等组件完成解析。典型流程包括:定位本地文件、执行解析命令、输出文本结果,再用于整理、比对或 AI 写作参考。对于带图表的 PDF,可以结合截图与 OCR 流程提取视觉内容;对于多份 PDF,则可以用脚本批量处理,减少人工复制粘贴。

适用边界

中文识别默认依赖 Tesseract,适合较简单的文本场景;如果需要更稳定的中文 OCR,建议配合 PaddleOCR 使用。复杂版式,例如密集表格、多栏排版,本地解析效果可能不如专门云端解析服务稳定。密码保护的 PDF 不能直接处理,超大文件建议分页或批量处理,避免内存压力。运行环境需要 Python 3.10 及以上,Office 与图片格式可能依赖系统组件。

使用场景

  • 处理单份本地 PDF 文章时,把正文提取为纯文本,供后续摘要、校对或写作参考。
  • 整理一批会议记录 PDF 时,用命令行批量导出文本,便于检索关键词和统一归档。
  • 审阅带图表的 PDF 时,对关键图表截图并运行 OCR,把图中文字补进分析稿。
  • 在 Python 脚本中解析本地 Word 和 Excel 文件,把字段内容合并进结构化数据。

适合人员

  • 需要离线处理敏感合同或报告,并把 PDF 正文提取成可编辑文本的文档工程师。
  • 经常用脚本整理多份 PDF 和 Office 文件,要求不依赖云端 API 的数据工程师。
  • 把论文、图表和报告文本导入 AI 工作流,做摘要、比对或标注的研究助理。
  • 维护本地内容管道,需要稳定解析 PDF、Word、Excel 和截图文字的自动化工程师。