离线录音转写工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6113fd9f/asr-transcribe-local。
技能介绍
核心痛点:安全与效率的平衡
很多团队需要将会议录音、访谈音频或线上课程快速转化为文字,以便进行纪要整理、内容归档或信息检索。然而,将涉及内部讨论、商业机密或未公开数据的录音文件上传至第三方云端服务,存在不可忽视的数据泄露风险,这对于企业、尤其是对信息安全有严格要求的单位(如国企、央企)来说,是一道无法绕过的红线。本技能旨在提供一个本地优先、离线可用的录音转文字解决方案,确保原始音频数据始终在本地设备处理。
它是如何工作的?
该技能通过调用本地的 whisperX 等 ASR(自动语音识别)引擎进行转写,核心工作流分为以下关键步骤:
- 环境自检:执行
scripts/check_env.py检测ffmpeg、语音模型库(如whisperx)以及可选的说话人分离模型(如pyannote)是否就绪。这是决策的基础。 - 智能分支决策:
本地优先:若环境完备,默认执行本地转写。这是推荐的默认路径,音频文件不会离开您的设备。
云端兜底:仅当本地引擎确实不可用(如缺少依赖且无法安装),且您明确同意上传文件后,才会调用云端 API(如通义千问 Paraformer 或 OpenAI Whisper)。这是一个降级选项,且云端通常不支持说话人分离。
- 灵活转写:支持
m4a,mp3,wav,flac,mp4等常见音视频格式。您可以指定模型大小(--model large-v3/medium/small)来平衡精度与性能,并通过--hint-words参数喂入特定行业术语或人名以提升转写准确率。对于多人对话,可启用--diarize参数进行说话人分离。 - 标准化输出:默认生成带时间戳的
.srt(字幕文件)和.vtt文件,以及纯文本.txt稿件。输出文件顶部会自动添加机器转写免责声明水印,提醒下游使用者进行人工核对。
适用边界与重要提示
- 这不是“精校稿”:ASR 输出是机器转写,必然存在错字、同音字错误,尤其是在处理专有名词、数字和方言口音时。所有产出的文字稿均需人工审校后方可用于正式纪要或发布。
- 隐私保护机制:对于国企/央企等敏感场景,默认的本地模式是硬约束。云端功能是应急补充,启用前系统会进行严格确认。
- 集成工作流:本技能产出的
.txt和.srt文件可作为下游分析技能(如会议纪要生成、访谈洞察提取)的标准输入。转写完成后,可主动询问是否进行下一步处理。
使用场景
- 将部门周会的全程录音(.m4a 格式)转为带时间戳的文字稿(.srt/.txt),以便快速整理成会议纪要并分发给参会者确认。
- 处理与客户的深度访谈录音(时长超1.5小时),生成初步文字记录并标注说话人,为后续的用户洞察分析报告提供原始素材。
- 把一期英文播客的音频文件(.mp3)转写成双语字幕文件(.srt),方便在视频平台发布时添加多语言字幕选项。
- 将线下培训课程的录像(.mp4)转为可搜索的纯文本讲义,供未能参训的员工快速查阅重点内容。
适合人员
- 需要将每周部门会议录音整理成正式纪要的行政文员或团队助理。
- 负责整理客户深度访谈录音,为产品经理提供原始洞察素材的市场研究员。
- 为播客或访谈类视频节目制作多语言字幕的独立内容创作者。
- 管理内部培训材料,需将线下课程录像归档为可检索文档的企业培训专员。