MarkItDown 文档转换
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/markitdown-cn。
技能介绍
解决的问题
大模型工作流里,经常要先处理 PDF、DOCX、PPTX、XLSX、扫描件、音频、网页和 YouTube 转录等异构输入。手工整理会破坏结构,表格、备注、元数据和 OCR 文本容易丢失;直接喂原始二进制或 HTML 给 LLM,token 成本与理解质量都不稳定。
核心能力
MarkItDown转换 基于微软 MarkItDown,把常见文档转换为结构化 Markdown,适合审阅、检索、分析和二次生成:
- 办公文档:
PDF、DOCX、PPTX、XLSX,保留表格与关键格式 - 视觉与扫描:
JPEG、PNG、GIF、WebP,支持 EXIF 元数据和 OCR - 音视频与网页:
WAV、MP3转录,HTML、CSV、JSON、XML、EPUB、ZIP等转换 - AI 增强:通过 OpenRouter 生成图像描述,复杂 PDF 可用 Azure 文档智能
适用边界
OCR、语音转录、AI 图像描述依赖额外包、API 或计算资源;大文件和批量任务需要控制分页、并发与错误处理。它解决的是文档到 Markdown 的标准化,不是自动研究或最终报告生成。
使用场景
- 将客户发来的 DOCX、PDF 和 PPTX 统一转为 Markdown,便于 LLM 做条款审阅。
- 从 Excel 表和图片中抽取表格与 OCR 文本,整理成 Markdown 供分析模型使用。
- 把 YouTube 链接和 WAV 音频转成转录文本,再转 Markdown 归档到知识库。
- 用 AI 图像描述把 PPTX 图片说明补全,输出 Markdown 用于生成讲解稿。
适合人员
- 文档工程师:需要把多格式办公文件统一清洗成可被 LLM 解析的 Markdown。
- 数据分析师:要从 Excel、CSV、扫描件中提取表格和 OCR 文本进入分析流程。
- LLM 应用工程师:要为检索增强或工作流准备结构清晰且 token 友好的输入。
- 研究助理:需要批量转换 PDF、EPUB 和 YouTube 转录,形成可审阅文献底稿。