Agent Skills
返回列表
Markdown 文件转换器

Markdown 文件转换器

知识管理 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e8ecaff7/test1-new。

技能介绍

问题

处理文档时,PDF、Office、HTML、CSV、JSON 和图片里的文本常常分散在二进制格式或网页结构中,人工复制会丢失标题、表格、列表等层级。直接把原始文件喂给大模型或知识库,也容易因为格式不统一而降低可用性。这个技能把常见文件统一转成 Markdown,作为后续阅读、检索、索引或模型处理的中间格式。

工作方式

技能通过 uvx markitdown 运行转换,不需要额外安装主程序。支持 Documents:PDF、Word(.docx)、PowerPoint(.pptx)、Excel(.xlsx / .xls);Web/Data:HTML、CSV、JSON、XML;Media:图片的 EXIF 与 OCR、音频的 EXIF 与转写;以及 ZIP 内容遍历、YouTube URL、EPub。输出保留文档结构,包括标题、表格、列表和链接。首次运行会缓存依赖,后续执行更快。对于复杂 PDF 或抽取效果不佳的文件,可按资料中的建议结合 Azure Document Intelligence 的 -d 参数处理。适合把散落文件整理成可版本控制的纯文本,而不适合处理受 DRM 保护、扫描件质量过低或必须还原原始排版的内容。

使用场景

  • 将多份 PDF、Word 和 PPT 汇报材料转成 Markdown,便于统一检索和交给模型总结。
  • 把 HTML、CSV、JSON、XML 接口样例导出为 Markdown,方便归档接口说明。
  • 从图片和音频提取 EXIF 与 OCR/转写文本,生成可编辑 Markdown 记录。
  • 遍历 ZIP 包内文档并逐一转 Markdown,用于批量整理离线资料。

适合人员

  • 需要把 PDF、Office 和网页资料转成可检索文本的知识库工程师。
  • 负责整理接口样例、CSV、JSON 和 HTML 文档的数据工程师。
  • 要从图片、音频里提取 OCR 与转写内容的研究助理。
  • 批量处理 ZIP 离线资料并归档为纯文本的文档维护者。