Agent Skills
返回列表
文档能听

文档能听

办公效率 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_aad6add3/doc-to-speech。

技能介绍

解决什么

文档阅读依赖视觉输出,通勤、长时间阅读、会议间隙、视力不便等场景下,纯文本不容易持续消费。该技能把已有文档转成可播放的 MP3,让内容从“读”变成“听”。它不是实时朗读窗口,也不是视频字幕工具,而是面向本地文件批量的音频生成流程,适合把报告、资料、Markdown 笔记先转成随身可听的内容。

工作方式与边界

核心路径是:先提取文档文本,再调用 TTS 引擎合成语音,最后输出音频文件。常见输入包括 .docx、.pdf、.txt、.md,也可以处理整个文件夹。文本提取通常依赖 docx2txt、pdfplumber 或 PyPDF2;语音合成可选择离线 pyttsx3 或在线 gTTS。离线方案响应快、无网络依赖,但音色可能一般;在线方案更自然,但受网络与请求限制影响。长文档会分段处理;扫描版 PDF 需要先 OCR;复杂版式可能导致文本不完整。使用时要确认输入路径、输出路径、语音、语速和语言参数,并在生成后检查 MP3 是否可播放、是否出现漏字或顺序错乱。

使用场景

  • 通勤前把多份 PDF 报告批量转成 MP3,在路上听结论和附录。
  • 把一周的 Markdown 技术笔记按文件夹转成音频,方便午休时复查。
  • 将培训资料 .docx 转成中文 MP3,供视力不便学员课后收听。
  • 会议结束后把 TXT 纪要批量合成语音,发给无法长时间阅读的成员。

适合人员

  • 长期阅读论文和报告的科研人员,需要把 PDF 转成可离线听的中文音频。
  • 维护技术文档的工程师,想把 Markdown 草稿批量转成 MP3 做复查。
  • 准备内部培训的讲师,需要把 Word 培训材料合成语音供学员回听。
  • 有视力辅助需求的阅读者,需要把 TXT 和 Markdown 文本转为语音。