Omni Reader 多模态文档解析
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-y1eh5fyg/cue-omni-reader。
技能介绍
解决的问题
多模态资料常分散在 PDF、Office、图片、网页、录音和视频里。工程师要把这些内容变成可检索、可交给 Agent 的文本时,常遇到排版顺序丢失、表格结构被拆散、扫描件无法读取、音视频缺少画面语义等具体问题。
工作方式
omni-reader 将输入解析为 markdown 或 clean text。PDF 与 Office 文档保留阅读顺序和表格结构;图片与扫描件通过 OCR 和视觉理解提取内容;音频使用 ASR 转写;视频结合 ASR、关键帧画面分析和多模态融合。URL 可直接解析,本地文件通过用户指定路径处理。解析状态、结果读取、取消和导出等动作通过 MCP 工具暴露,后端程序也可以走 HTTP API 接入。
适用边界
单次只处理一个文件,单文件上限约 256 MiB。大文件建议拆分,视频建议按 15–30 分钟分段。默认 no_store=true,源文件和结果不上传服务端;但实际解析依赖远程服务,可能受网络、配额、高峰期和服务状态影响。oss:// 等不可直接访问地址应先转为签名 HTTPS URL。
使用场景
- 把会议录音转成可检索文本纪要,便于后续检索引用
- 将扫描件和手写表格转成结构化文字,补录到项目文档里
- 解析产品视频中的字幕与关键画面,生成带上下文的技术摘要
- 把网页、表格和文档说明转成同一份检索文本,便于比对
适合人员
- 要把会议录音转成文本纪要的项目助理
- 常处理扫描合同和手写表格的运营专员
- 需要把视频讲解和字幕整理成检索材料的培训负责人
- 将文档说明、网页和表格接入智能体知识库的工程师