Agent Skills
返回列表
Omni Reader 多模态文档解析

Omni Reader 多模态文档解析

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @org-y1eh5fyg/cue-omni-reader。

技能介绍

解决的问题

多模态资料常分散在 PDF、Office、图片、网页、录音和视频里。工程师要把这些内容变成可检索、可交给 Agent 的文本时,常遇到排版顺序丢失、表格结构被拆散、扫描件无法读取、音视频缺少画面语义等具体问题。

工作方式

omni-reader 将输入解析为 markdown 或 clean text。PDF 与 Office 文档保留阅读顺序和表格结构;图片与扫描件通过 OCR 和视觉理解提取内容;音频使用 ASR 转写;视频结合 ASR、关键帧画面分析和多模态融合。URL 可直接解析,本地文件通过用户指定路径处理。解析状态、结果读取、取消和导出等动作通过 MCP 工具暴露,后端程序也可以走 HTTP API 接入。

适用边界

单次只处理一个文件,单文件上限约 256 MiB。大文件建议拆分,视频建议按 15–30 分钟分段。默认 no_store=true,源文件和结果不上传服务端;但实际解析依赖远程服务,可能受网络、配额、高峰期和服务状态影响。oss:// 等不可直接访问地址应先转为签名 HTTPS URL。

使用场景

  • 把会议录音转成可检索文本纪要,便于后续检索引用
  • 将扫描件和手写表格转成结构化文字,补录到项目文档里
  • 解析产品视频中的字幕与关键画面,生成带上下文的技术摘要
  • 把网页、表格和文档说明转成同一份检索文本,便于比对

适合人员

  • 要把会议录音转成文本纪要的项目助理
  • 常处理扫描合同和手写表格的运营专员
  • 需要把视频讲解和字幕整理成检索材料的培训负责人
  • 将文档说明、网页和表格接入智能体知识库的工程师