PDF/EPUB/MOBI 转 TXT 与 Markdown 翻译
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_1793b15c/pdfconversion-v1。
技能介绍
解决什么问题
电子书常以 EPUB、MOBI、PDF 分散存在,正文提取后仍需清洗、结构化、翻译。手工复制会破坏章节,调用在线模型又带来 token 成本、隐私和离线限制。这个技能面向本地处理:把常见电子书格式转成可编辑文本,再用脚本生成 Markdown,并在需要时完成多语言翻译。
技能如何工作
- 格式转换:
epub-to-txt、mobi-to-txt、pdf-to-txt将单本或批量文件导出为TXT,其中 MOBI 依赖mobi,PDF 可用clawpdf与PyMuPDF兜底。 - 扫描版支持:
pdf-to-txt-ocr使用本地RapidOCR处理无文字层 PDF,适合影印本和出版社扫描书。 - 结构化:
txt-to-md将标题、作者、小节等转换为#、###和斜体等 Markdown 规则。 - 翻译:
txt-translate基于本地Argos Translate离线翻译,支持保留章节结构、双语对照和断点续传。 - 批量:
workspace-batch-convert可解析书单、跨格式路由、跳过已转文件并输出汇总报告。
边界与注意点
技能主要解决“可提取文本”的电子书转换,纯图片 EPUB 仍需先导出图片再 OCR;复杂多栏排版可能出现串行。离线翻译质量适合通读理解,不等同于出版级翻译。处理特殊文件名、长路径或 Windows 控制台编码时,应优先以产物文件是否存在且内容完整为准。
使用场景
- 整理一批英文 EPUB 技术书,批量转成 TXT 并渲染为 Markdown,便于在本地笔记工具中编辑。
- 处理出版社扫描版 PDF,先用本地 OCR 提取文字,再转成 TXT,为后续检索和摘要做准备。
- 把一文件夹 MOBI 和 EPUB 混合书籍一次性转出 TXT,跳过已有文件,并查看成功、失败汇总。
- 将英文 TXT 章节翻译成中文,保留标题和章节结构,输出双语对照供同事通读理解。
适合人员
- 维护个人知识库的工程师,需要把电子书正文变成可编辑 Markdown,减少复制粘贴。
- 处理教材或行业资料的编辑,需要批量提取 EPUB、PDF、MOBI 文本并生成结构稿。
- 离线处理文档的翻译助理,需要将英文 TXT/MD 转成中文并保留章节格式。
- 整理混合电子书目录的研究助理,需要一次批量转换并得到成功/失败汇总。