Agent Skills
返回列表
MarkItDown 多格式转 Markdown

MarkItDown 多格式转 Markdown

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a7465146/markitdown-uvx。

技能介绍

解决的问题

办公文档、网页、媒体文件常以二进制或专有格式存储,直接喂给 LLM 会丢失结构、编码混乱、无法批量处理。markitdown 把这些输入统一转成 Markdown,保留标题、列表、表格和链接,让模型更容易解析上下文。

工作方式

它通过 CLI 接收文件或 stdin,根据扩展名、MIME、编码提示选择转换路径;可用 -o 指定输出,-x pdf 处理标准输入,--keep-data-uris 保留 base64 图片。常见格式如 PDF、DOCX、PPTX、XLSX、HTML、EPUB、CSV 等可直接处理;ZIP 会遍历并逐个转换;音频和 YouTube 需要对应转写能力。

适用边界

文本提取优先,不保证还原 PDF 图片、复杂版式或扫描内容;音频依赖 ffmpeg 与转写组件。若需要更强视觉内容,应结合 OCR 与 LLM 二次识别。批量处理时建议先验证依赖 extras 是否齐全,避免某些格式静默失败。

使用场景

  • 把一份 PDF 技术手册转成 Markdown,提取章节标题、列表和表格供 LLM 问答。
  • 将 ZIP 内多个 Excel 和 HTML 文件批量转文本,便于统一检索字段。
  • 从 DOCX/PPTX 文档中抽取结构化正文,生成模型可读的提示词素材。
  • 读取图片 EXIF 元数据并保留 base64 数据,用于后续视觉分析流程。

适合人员

  • 构建 RAG 系统的工程师:把 PDF/DOCX/PPTX 转 Markdown 作为模型上下文。
  • 数据工程师:批量解析 ZIP 中的 Excel/CSV,统一抽取表格字段。
  • 内容工程师:把 EPUB/HTML 文档转结构化文本,生成摘要和检索条目。
  • 评测工程师:将 PPTX/Word 文档正文提取为 Markdown,做生成质量比对。