Word 转 Markdown 图片保留
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_29e2fa9e/docx-to-md-with-images。
技能介绍
解决什么问题
很多 .docx 文档转 Markdown 后只剩正文,图片散落在临时目录,路径是绝对路径,HTML 样式残留。对需要归档、检索或二次编辑的工程师来说,这种低保真结果很难直接使用。本技能面向 .docx 转 .md 的高保真需求:保留标题、表格、列表、加粗/斜体等格式,并把图片提取为可用的相对路径资源。
工作方式与边界
核心流程优先使用 pandoc:先检测并可选自动安装 pandoc,再执行转换,最后用 fix_images.py 将 img/media/ 压平到 img/,把  路径修正为相对路径,并清理图片周围的 HTML 标签和样式属性。若 pandoc 不可用,可用 python-docx 回退脚本处理标题、行内格式、嵌套列表和表格,但该路径不提取图片。对于 PDF、PPTX、XLSX、HTML 等非 Word 格式,可尝试 uvx markitdown 回退;在部分 Windows 环境中可能因 onnxruntime DLL 问题失败,需要改用 python-pptx、openpyxl 等格式专用方案。注意:.emf 图片在 Markdown 查看器中兼容性差,建议转为 PNG;输出建议统一为 GFM,以获得更好兼容性。
使用场景
- 处理 Word 项目周报,需要保留标题、表格和图片,并转成 GFM 文档用于 Wiki 归档。
- 把客户提供的 .docx 说明书转成 Markdown,检查图片路径相对化并清理 HTML 样式残留。
- 在没有 pandoc 的机器上,用 python-docx 回退转换内部文档的标题、列表和表格,但图片需另行处理。
- 将 PPTX 或 XLSX 附件转成可检索文本,尝试 markitdown 并在失败时改用格式专用解析。
适合人员
- 维护技术文档库的工程团队,需要把 Word 规范转成可检索 Markdown 并保留截图。
- 处理产品验收材料的测试工程师,需要把 .docx 报告中的表格、列表和图片转成 Wiki 格式。
- 负责知识库归档的项目经理,需要把客户 Word 说明书转成统一 Markdown,并修正图片路径。
- 在受限环境做文档迁移的开发运维,需要在无 pandoc 时用 python-docx 保留标题、列表和表格。