录音转结构化笔记
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_4200edd7/record2note。
技能介绍
解决什么问题
手机里大量语音备忘录、会议录音常常停留在“有文件没内容”的状态。手动转录慢,简单转文字又缺少标题、摘要、待办和说话人区分,难以沉淀到 Obsidian、Notion 或 Logseq 中。record2note 面向这个场景:把音频处理成可检索、可归档、可继续编辑的结构化笔记。
核心工作方式
技能将录音流程拆成两段:转写流水线与笔记生成。
- 音频预处理:用
ffmpeg统一转为 16kHz 单声道 WAV,可选Silero-VAD跳过静音、afftdn做降噪。 - Whisper 转录:调用本地 Whisper,并采用 GPU → 限制线程 → CPU 的降级策略;按音频时长和模型大小计算超时,避免长录音卡死流水线。
- 说话人标记:开启
diarization时使用pyannote-audio分离说话人,把“甲/乙”等角色写回文本。 - 结构化笔记:转写结果先落到
pendingJSON,再由 Agent 按模板生成标题、摘要、关键要点、待办事项和完整转录。 - Obsidian 适配:在
note_mode=obsidian时输出 Callout、[[wikilink]]和自动维护的索引页,便于后续双链检索。
适用边界
该技能偏本地自动化,首次运行需要下载模型和依赖,large-v3 或说话人分离会占用数 GB 空间。自动监控依赖 macOS fswatch、Windows 计划任务,以及 iCloud、Syncthing 或手动投递文件。若使用 Agent CLI 自动触发,在 launchd 或无 bash 环境中可能遇到权限问题,可关闭自动触发并手动处理 pending 文件。
使用场景
- 把 iPhone 语音备忘录里的会议讨论自动同步到 Mac,并生成含说话人标记的 Obsidian 笔记。
- 将 30 分钟访谈录音转成 Markdown,提取摘要、关键要点和待办,便于归档到 Notion 或 Logseq。
- 在本地离线环境把手机导出音频转写,并用 pending JSON 批量生成中文笔记,避免上传原始音频。
- 用 Syncthing 配对 Android 手机和 Windows 电脑,把现场采访录音自动传入 watch 目录后生成转录。
适合人员
- 把会议录音沉淀进 Obsidian 双链笔记的个人知识管理者
- 需要把访谈录音转成摘要、要点和待办的研究员或编辑
- 希望用本地 Whisper 处理敏感音频、不愿上传云端的隐私敏感产品团队
- 希望用 iPhone 录音自动同步到 Mac 并生成笔记的独立顾问