Agent Skills
返回列表
知识产权官文 PDF 转 Markdown

知识产权官文 PDF 转 Markdown

行业专业 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_dcf8e29c/patent-pdf-to-md。

技能介绍

要解决的问题

处理中国专利文本时,PDF、DOCX、DOC 的章节结构、著录项目、权利要求、说明书和附图往往散落在不同段落与页面中。人工整理成本高,且专利公开/公告文件与审查意见、驳回决定等文件的版式差异明显,直接转换容易把正文、附图和审查理由混在一起。

技能如何工作

该技能接受 .pdf、.docx、.doc 输入,先识别文件类型并创建工作目录,再根据文本前 3000 字符自动判断属于专利公开/公告文件或审查文件,分流到对应工作流。解析流程会提取著录项目、摘要、权利要求书、说明书子章节,以及审查意见或决定理由;PDF 输入还可渲染说明书附图为 PNG 图片。

输出通常包括 output.json、output.md、output.txt 与 images/ 目录,便于后续检索、引用或批量入库。多文件场景下可按文件并行处理,单个文件失败不影响其他文件。

适用边界

.docx 与 .doc 不支持附图提取,因为缺少 PDF 页面渲染。.doc 需要 WPS、Microsoft Office 或 LibreOffice 转换为 .docx。OCR 引擎默认按 pdfplumber → fitz → MinerU flash-extract → Tesseract 降级,图像型 PDF 的质量依赖 OCR 结果。

使用场景

  • 收到专利公开 PDF 后,将权利要求书、说明书和附图整理成 Markdown,用于技术比对。
  • 处理审查意见通知书 DOCX 时,抽取著录项目和审查理由,生成可审阅的结构化 Markdown。
  • 将图像型专利 PDF 通过 OCR 转为 Markdown,并保留说明书附图 PNG,便于引用和标注。
  • 多份官文同时到期处理时,按文件并行生成 output.md、output.json 与 logs,便于入库和回溯。

适合人员

  • 专利代理师:整理公开文本与审查文件,提取权利要求、说明书、审查理由,便于答复和检索。
  • 企业 IP 分析师:把多份官文 PDF 转为 Markdown 和 JSON,用于案件追踪与归档。
  • 技术文档工程师:解析图像型专利 PDF 并保留附图 PNG,方便后续标注、比对和引用。
  • 法务助理:从 DOCX 审查意见中抽取著录项目与决定理由,生成可审阅 Markdown 版本。