本地 Whisper 语音转写
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @zcwl/openai-whisper。
技能介绍
面向的问题
当开发者需要处理本地音频时,常见需求并不是“把音频发到云端”,而是希望在本机完成 转写、翻译 和 字幕生成。这类任务通常涉及会议录音、采访音频、播客片段或视频素材,既希望避免不必要的外发,又需要得到可直接使用的文本或 SRT 文件。
核心能力与工作方式
该技能围绕 Whisper CLI 提供本地音频转写能力。它适合从已有音频文件出发,将语音内容转换为文本,并按需输出为不同媒体处理格式。
- 本地转写:直接读取
audio.mp3、audio.m4a等音频文件 - 模型选择:可使用较小模型追求速度,也可使用较大模型追求准确性
- 输出格式:支持
txt、srt等常见输出 - 翻译任务:可通过
translate任务将语音内容翻译为英文文本 - 缓存机制:首次运行时模型会下载到
~/.cache/whisper,后续运行复用本地模型
默认模型为 turbo,因此在日常使用中通常不需要手动指定模型;如果任务对延迟或资源占用敏感,可显式调整模型大小。
适用边界
这个技能更适合离线文件级转写,例如把一段录音整理成文字稿,或为视频素材生成字幕文件。它不是实时流式语音识别服务,也不等同于专业语音工作台;对强噪声、多人重叠、口音复杂或要求高准确字幕校对的任务,仍需结合人工审核。
使用场景
- 处理访谈录音,将 mp3 转成 txt 文稿以便整理要点。
- 给视频剪辑素材生成 srt 字幕,供后期导入剪辑工具。
- 将外语语音片段翻译成英文文本,用于快速核对内容。
- 把多段会议录音分别转写成本地文本,避免上传云端。
适合人员
- 需要把采访音频整理成文字稿的播客剪辑师。
- 要做字幕制作和字幕校对的视频编辑。
- 需要快速翻译外语录音内容的本地化运营。
- 在离线环境中处理媒体素材的独立开发者。