PDF 转 Markdown
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-rn88lg3j/pdf-md。
技能介绍
解决的问题
PDF 里的文本、表格、图表常常散落在页面中,直接复制会得到乱序文本、缺失层级或丢失关键图示。PDF 转 Markdown 面向办公效率场景,把单篇或同目录多篇 PDF 整理为可维护的 Markdown 知识文档,减少人工重排、摘录和目录整理,尤其适合教程、规范、教材和内部文档的二次阅读。
工作方式与边界
- 结构化抽取:识别章节层级,输出
#、##、###标题、列表和表格,保持标题层级、列表缩进和表格行列完整,默认保留原文明确知识点,不擅自补充。 - OCR 与图片处理:扫描件需配置
XBY_APIKEY后调用 OCR;对流程图、架构图、表格截图、操作指引等图片会保留引用,并在附近补充上下文描述。 - 批量与索引:处理同目录 PDF 后可生成
Wiki.md索引,包含章节目录、关联关系和统计信息;不确定层级、术语或命名时会询问使用者。 - 使用边界:OCR 结果为机器识别,质量不佳时会标注
[待确认]或[提取失败],不会读取其它 PDF 或已有整理文件来填补空缺。
使用场景
- 整理教材章节时,将 PDF 标题层级、列表和表格输出为可编辑 Markdown。
- 处理产品手册时,把扫描页识别为 Markdown 并保留图表上下文。
- 归档内部规范时,把同目录多份 PDF 批量生成知识文档并建立 Wiki 索引。
- 处理扫描件时,在配置密钥后识别页面文字,并对低质量页显式标注待确认。
适合人员
- 需要把课程 PDF 整理成复习笔记的研究生
- 负责将供应商技术文档归档为知识库的工程师
- 需要批量处理培训教材并生成目录索引的行政人员
- 要维护内部规范 Markdown 库的技术写作者