Agent Skills
返回列表
本地 Whisper 语音转写

本地 Whisper 语音转写

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @zcwl/openai-whisper。

技能介绍

面向的问题

当开发者需要处理本地音频时,常见需求并不是“把音频发到云端”,而是希望在本机完成 转写、翻译 和 字幕生成。这类任务通常涉及会议录音、采访音频、播客片段或视频素材,既希望避免不必要的外发,又需要得到可直接使用的文本或 SRT 文件。

核心能力与工作方式

该技能围绕 Whisper CLI 提供本地音频转写能力。它适合从已有音频文件出发,将语音内容转换为文本,并按需输出为不同媒体处理格式。

  • 本地转写:直接读取 audio.mp3、audio.m4a 等音频文件
  • 模型选择:可使用较小模型追求速度,也可使用较大模型追求准确性
  • 输出格式:支持 txt、srt 等常见输出
  • 翻译任务:可通过 translate 任务将语音内容翻译为英文文本
  • 缓存机制:首次运行时模型会下载到 ~/.cache/whisper,后续运行复用本地模型

默认模型为 turbo,因此在日常使用中通常不需要手动指定模型;如果任务对延迟或资源占用敏感,可显式调整模型大小。

适用边界

这个技能更适合离线文件级转写,例如把一段录音整理成文字稿,或为视频素材生成字幕文件。它不是实时流式语音识别服务,也不等同于专业语音工作台;对强噪声、多人重叠、口音复杂或要求高准确字幕校对的任务,仍需结合人工审核。

使用场景

  • 处理访谈录音,将 mp3 转成 txt 文稿以便整理要点。
  • 给视频剪辑素材生成 srt 字幕,供后期导入剪辑工具。
  • 将外语语音片段翻译成英文文本,用于快速核对内容。
  • 把多段会议录音分别转写成本地文本,避免上传云端。

适合人员

  • 需要把采访音频整理成文字稿的播客剪辑师。
  • 要做字幕制作和字幕校对的视频编辑。
  • 需要快速翻译外语录音内容的本地化运营。
  • 在离线环境中处理媒体素材的独立开发者。