Agent Skills
返回列表
语音会议转写纪要

语音会议转写纪要

办公效率 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a3d77f06/audio-meeting-transcript。

技能介绍

问题背景

会议录音通常包含多人交叉发言,直接转文字后难以定位谁在何时说了什么,后续摘要也缺少决策和待办线索。该技能面向本地音频处理:先把 mp3、m4a、flac 等文件归一为 16kHz 单声道 WAV,再基于离线 Vosk 做语音识别,减少音频上传到服务器的依赖。

工作方式

流程分为四步:音频预处理、转写与说话人分离、Markdown 录音稿格式化、AI 生成会议纪要。核心输出是带 speaker_label、start、end 和 text 的 segments 数组,随后渲染成可阅读的对话稿。

  • Full 模式:使用 vosk-model-spk-0.4 提取声纹,通过聚类区分说话人,支持自动估算或手动指定人数。
  • Lite 模式:不依赖声纹模型,基于静音停顿推断切换,适合快速预览。
  • 模型查找:优先环境变量 VOSK_MODEL_PATH,其次技能本地 ./models/、用户目录和系统目录,也允许 --model 与 --spk-model 手动指定。

适用边界

中文小模型约 42MB,适合常见对话,但对专业术语和方言可能不够稳;更高精度可换约 1.3GB 的中文大模型。超过 30 分钟的录音,处理时间可能约为音频时长的 0.3 到 0.5 倍。若说话人切换密集,Full 模式通常比 Lite 模式更容易得到稳定分段;会议纪要由 Agent 根据录音稿生成,适合补充摘要、议题、决策和待办,而不是替代人工审核。

使用场景

  • 复盘线上产品评审录音,生成带时间戳的发言稿并提取决策项
  • 整理客户电话会议音频,区分不同说话人并输出待办事项清单
  • 本地离线转写多段内部访谈录音,避免上传敏感会议音频
  • 把远程评审会 mp3 转成 Markdown 稿,核对谁提出阻塞问题

适合人员

  • 负责产品评审记录的工程师,需要快速定位谁提出阻塞并核对决策
  • 管理客户电话会议的顾问,要生成带说话人标签的纪要和待办
  • 处理内部访谈录音的研究员,需要在离线环境转写多人发言
  • 维护技术评审会议资料的文档负责人,要核对发言时间戳