Agent Skills
返回列表
录音转结构化笔记

录音转结构化笔记

知识管理 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_4200edd7/record2note。

技能介绍

解决什么问题

手机里大量语音备忘录、会议录音常常停留在“有文件没内容”的状态。手动转录慢,简单转文字又缺少标题、摘要、待办和说话人区分,难以沉淀到 Obsidian、Notion 或 Logseq 中。record2note 面向这个场景:把音频处理成可检索、可归档、可继续编辑的结构化笔记。

核心工作方式

技能将录音流程拆成两段:转写流水线与笔记生成。

  • 音频预处理:用 ffmpeg 统一转为 16kHz 单声道 WAV,可选 Silero-VAD 跳过静音、afftdn 做降噪。
  • Whisper 转录:调用本地 Whisper,并采用 GPU → 限制线程 → CPU 的降级策略;按音频时长和模型大小计算超时,避免长录音卡死流水线。
  • 说话人标记:开启 diarization 时使用 pyannote-audio 分离说话人,把“甲/乙”等角色写回文本。
  • 结构化笔记:转写结果先落到 pending JSON,再由 Agent 按模板生成标题、摘要、关键要点、待办事项和完整转录。
  • Obsidian 适配:在 note_mode=obsidian 时输出 Callout、[[wikilink]] 和自动维护的索引页,便于后续双链检索。

适用边界

该技能偏本地自动化,首次运行需要下载模型和依赖,large-v3 或说话人分离会占用数 GB 空间。自动监控依赖 macOS fswatch、Windows 计划任务,以及 iCloud、Syncthing 或手动投递文件。若使用 Agent CLI 自动触发,在 launchd 或无 bash 环境中可能遇到权限问题,可关闭自动触发并手动处理 pending 文件。

使用场景

  • 把 iPhone 语音备忘录里的会议讨论自动同步到 Mac,并生成含说话人标记的 Obsidian 笔记。
  • 将 30 分钟访谈录音转成 Markdown,提取摘要、关键要点和待办,便于归档到 Notion 或 Logseq。
  • 在本地离线环境把手机导出音频转写,并用 pending JSON 批量生成中文笔记,避免上传原始音频。
  • 用 Syncthing 配对 Android 手机和 Windows 电脑,把现场采访录音自动传入 watch 目录后生成转录。

适合人员

  • 把会议录音沉淀进 Obsidian 双链笔记的个人知识管理者
  • 需要把访谈录音转成摘要、要点和待办的研究员或编辑
  • 希望用本地 Whisper 处理敏感音频、不愿上传云端的隐私敏感产品团队
  • 希望用 iPhone 录音自动同步到 Mac 并生成笔记的独立顾问