Agent Skills
返回列表
PDF/EPUB/MOBI 转 TXT 与 Markdown 翻译

PDF/EPUB/MOBI 转 TXT 与 Markdown 翻译

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_1793b15c/pdfconversion-v1。

技能介绍

解决什么问题

电子书常以 EPUB、MOBI、PDF 分散存在,正文提取后仍需清洗、结构化、翻译。手工复制会破坏章节,调用在线模型又带来 token 成本、隐私和离线限制。这个技能面向本地处理:把常见电子书格式转成可编辑文本,再用脚本生成 Markdown,并在需要时完成多语言翻译。

技能如何工作

  • 格式转换:epub-to-txt、mobi-to-txt、pdf-to-txt 将单本或批量文件导出为 TXT,其中 MOBI 依赖 mobi,PDF 可用 clawpdf 与 PyMuPDF 兜底。
  • 扫描版支持:pdf-to-txt-ocr 使用本地 RapidOCR 处理无文字层 PDF,适合影印本和出版社扫描书。
  • 结构化:txt-to-md 将标题、作者、小节等转换为 #、### 和斜体等 Markdown 规则。
  • 翻译:txt-translate 基于本地 Argos Translate 离线翻译,支持保留章节结构、双语对照和断点续传。
  • 批量:workspace-batch-convert 可解析书单、跨格式路由、跳过已转文件并输出汇总报告。

边界与注意点

技能主要解决“可提取文本”的电子书转换,纯图片 EPUB 仍需先导出图片再 OCR;复杂多栏排版可能出现串行。离线翻译质量适合通读理解,不等同于出版级翻译。处理特殊文件名、长路径或 Windows 控制台编码时,应优先以产物文件是否存在且内容完整为准。

使用场景

  • 整理一批英文 EPUB 技术书,批量转成 TXT 并渲染为 Markdown,便于在本地笔记工具中编辑。
  • 处理出版社扫描版 PDF,先用本地 OCR 提取文字,再转成 TXT,为后续检索和摘要做准备。
  • 把一文件夹 MOBI 和 EPUB 混合书籍一次性转出 TXT,跳过已有文件,并查看成功、失败汇总。
  • 将英文 TXT 章节翻译成中文,保留标题和章节结构,输出双语对照供同事通读理解。

适合人员

  • 维护个人知识库的工程师,需要把电子书正文变成可编辑 Markdown,减少复制粘贴。
  • 处理教材或行业资料的编辑,需要批量提取 EPUB、PDF、MOBI 文本并生成结构稿。
  • 离线处理文档的翻译助理,需要将英文 TXT/MD 转成中文并保留章节格式。
  • 整理混合电子书目录的研究助理,需要一次批量转换并得到成功/失败汇总。