URL 音频转文字
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_03f2ab96/yuyinzhuanxie。
技能介绍
要解决的问题
当你手里只有会议录音、播客、视频课程或网页音频链接,却需要快速拿到可编辑文字时,单独处理下载、转码、模型推理容易分散。此技能把 URL 音频 到 纯文本 的链路串成一条命令:通过 yt-dlp 抓取可下载的音频源,用 ffmpeg 预处理为 16kHz 单声道 WAV,再交给 Faster-Whisper 完成语音识别,最终输出适合检索、总结、二次加工的文本。
工作方式与边界
它默认选择 base 模型,适合一般中文或英文场景;可通过模型参数切换 tiny 到 large,在速度、体积和准确率之间取舍。识别语言默认 zh,也支持 en 或自动判断;量化默认 int8,偏重 CPU 可用性,若显存或内存允许可尝试 float16 / float32。链路中包含 VAD,用于减少静音和非语音片段对结果的干扰,并在 torch.cuda.is_available() 时自动启用 GPU,否则退回 CPU。
需要注意,该技能依赖外网或可达的 HuggingFace 镜像下载模型,首次运行会拉取对应模型;在离线或受限网络中,需要按资料准备模型与依赖。它适合已有音频 URL、需要快速转写的工程场景,不适合完全本地化部署未准备模型的封闭环境,也不保证对强噪声、多人抢话或专业术语达到高准确。
使用场景
- 从在线课程视频链接提取讲解音频,并转写成可检索的笔记文本。
- 会议录音放在可下载链接,需要快速得到中文文字稿以核对要点。
- 只从播客链接下载原音频文件,保存后再另行校对或处理。
- 将外语教学视频的音频转成文本,便于整理术语清单与翻译对照。
适合人员
- 整理技术文档的工程师:把演示视频讲解转成文字后补写操作手册。
- 播客编辑:从公开音频链接提取文字稿,便于剪贴引用和归档。
- 本地化测试人员:将多段外语视频音频转写,核对字幕与术语翻译。
- 研究助理:下载讲座音频并生成文本,支撑资料摘录与检索。