音频转 Word 文档
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_b5009730/audio-to-docx。
技能介绍
解决的问题
录音文件往往只是原始语音,难以直接用于纪要、归档或后续检索。手动听写慢,通用在线工具又可能把敏感会议内容传到外部服务。这个技能面向中文录音,把本地 mp3、wav、m4a 等文件转写成结构化的 .docx 文稿,减少从“听到”到“可用文字”的手工环节。
如何工作
技能在本机调用 faster-whisper 完成语音识别,默认使用 CPU + int8 推理,适合没有 GPU 的机器;如果存在 CUDA 环境,也可以按已有运行库配置加速。转写结果会整理成 Word 文档,包含三部分:会议信息头、一、转录正文、二、逐句时间戳转录。正文按停顿合并为自然段落,附录保留 [HH:MM:SS] 时间戳,便于核对上下文。脚本还会处理中文路径临时副本、繁转简、python-docx 中文字体设置,以及 hf-mirror.com 模型下载,降低国内网络与常见桌面环境下的使用摩擦。
适用边界
该技能更适合中文会议、访谈或语音备忘整理,不是实时字幕工具。medium 模型在普通 CPU 上可能接近 1.2~2 倍实时,长录音会耗时较久,需要后台运行并通过日志确认 DONE 与文件存在。识别稿对专业术语、同音字和多人交叠说话仍可能有误差,交付前应提醒用户核对关键事实、姓名与数据。
使用场景
- 会议结束后,将本地 m4a 录音转成带时间戳的 Word 纪要底稿。
- 访谈或培训录音需要留存,把 wav 文件转写为可编辑的正文文稿。
- 多人讨论录音要核对发言时间点,生成逐句时间戳转录附录。
- 在离线或内网环境处理中文会议语音,避免上传外部转写服务。
适合人员
- 需要整理中文会议录音并输出 Word 纪要底稿的项目助理。
- 要核对访谈发言时间点的产品或运营人员。
- 负责语音素材归档且避免上传外部服务的合规运营。
- 需要本地处理长录音并生成带时间戳文稿的培训协调人。