语音会议转写纪要
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a3d77f06/audio-meeting-transcript。
技能介绍
问题背景
会议录音通常包含多人交叉发言,直接转文字后难以定位谁在何时说了什么,后续摘要也缺少决策和待办线索。该技能面向本地音频处理:先把 mp3、m4a、flac 等文件归一为 16kHz 单声道 WAV,再基于离线 Vosk 做语音识别,减少音频上传到服务器的依赖。
工作方式
流程分为四步:音频预处理、转写与说话人分离、Markdown 录音稿格式化、AI 生成会议纪要。核心输出是带 speaker_label、start、end 和 text 的 segments 数组,随后渲染成可阅读的对话稿。
- Full 模式:使用
vosk-model-spk-0.4提取声纹,通过聚类区分说话人,支持自动估算或手动指定人数。 - Lite 模式:不依赖声纹模型,基于静音停顿推断切换,适合快速预览。
- 模型查找:优先环境变量
VOSK_MODEL_PATH,其次技能本地./models/、用户目录和系统目录,也允许--model与--spk-model手动指定。
适用边界
中文小模型约 42MB,适合常见对话,但对专业术语和方言可能不够稳;更高精度可换约 1.3GB 的中文大模型。超过 30 分钟的录音,处理时间可能约为音频时长的 0.3 到 0.5 倍。若说话人切换密集,Full 模式通常比 Lite 模式更容易得到稳定分段;会议纪要由 Agent 根据录音稿生成,适合补充摘要、议题、决策和待办,而不是替代人工审核。
使用场景
- 复盘线上产品评审录音,生成带时间戳的发言稿并提取决策项
- 整理客户电话会议音频,区分不同说话人并输出待办事项清单
- 本地离线转写多段内部访谈录音,避免上传敏感会议音频
- 把远程评审会 mp3 转成 Markdown 稿,核对谁提出阻塞问题
适合人员
- 负责产品评审记录的工程师,需要快速定位谁提出阻塞并核对决策
- 管理客户电话会议的顾问,要生成带说话人标签的纪要和待办
- 处理内部访谈录音的研究员,需要在离线环境转写多人发言
- 维护技术评审会议资料的文档负责人,要核对发言时间戳