Agent Skills
返回列表
FunASR 音频转录

FunASR 音频转录

设计多媒体 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_e8cce942/funasr-transcriber。

技能介绍

适用问题

当原始资料是会议录音、访谈 MP3、视频音轨,需要得到带标点的文字稿时,FunASR 音频转录把音频或视频中的语音转成文本。它面向的是“已有声音文件,缺少可检索文字”的场景,而不是实时字幕或视频内容理解。

工作方式

技能基于 FunASR 提供可配置的转录流程。可直接处理 WAV、MP3、M4A、FLAC 等音频格式;视频文件需要先通过 FFmpeg 抽取音频。默认使用 --model=sensevoice,对应 SenseVoiceSmall,约 234M 参数,适合中文、粤语、英文、日文、韩文,并支持情绪与事件检测。若追求更多语言和更高准确率,可切换 --model=nano,对应 Fun-ASR-Nano-2512,约 800M 参数,支持 31 种语言和方言。VAD 与标点模型会按需自动加载:fsmn-vad 做语音活动检测,ct-punc 恢复中英文标点。

使用边界

它主要解决语音转文字,不做画面描述、章节摘要或翻译输出。选择模型时要看语言覆盖、参数规模和准确率需求;若音频背景噪声复杂或语种不在列表中,需要先确认模型支持情况,再决定使用 SenseVoice 还是 Nano。

使用场景

  • 把访谈 MP3 转成带标点的中文文本,再整理成可检索的会议记录。
  • 将视频讲座音轨用 FFmpeg 抽出音频后,生成英文或中文文字稿。
  • 对多段会议 WAV 做语音活动检测与标点恢复,得到分段可读的转录结果。
  • 用 Nano 模型转录包含方言或少见语种的音频,获得更高准确率文字稿。

适合人员

  • 每周要把访谈 MP3 整理成可检索文字稿的播客编辑
  • 负责把视频课程音轨转成文字底稿的课程制作人员
  • 处理多段会议 WAV 并需要 VAD 与标点恢复的音频工程师
  • 识别方言或少见语种、追求更高准确度的本地化研究员