Agent Skills
返回列表
视频文字稿提取方法

视频文字稿提取方法

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @efficient-technology/video-transcript-method。

技能介绍

问题

视频中的核心信息通常在语音里,但工程师拿到 B 站、YouTube 或播客链接后,仍要手工判断是否有 CC 字幕、下载音频、跑 Whisper、整理分段和要点。缺少统一流程时,结果容易混入重复语气词、机械按时长切段,或把要点总结成非原意内容。

技能如何工作

本技能把视频文字稿提取拆成三条主线:

  • 字幕优先:先解析 URL、识别平台和视频 ID,再用 yt-dlp --list-subs 检测 CC 字幕;有中文字幕时直接取字幕,避免不必要的语音识别。
  • Whisper 兜底:无字幕时下载 mp3 音频轨,调用 Whisper 生成带时间戳文本;默认 medium 模型,FP16 不可用时降级 FP32。
  • 语义整理:按内容逻辑分段,生成章节标题、时间范围、要点表格和原文金句,输出 .txt 或 .md。

适用边界

它适合任何 yt-dlp 支持且语音承载核心信息的在线视频;弹幕不等于 CC 字幕,未登录或平台限制可能影响字幕获取。Whisper 准确率受音频质量影响,提取内容仍需检查版权、完整性和时间戳误差。

使用场景

  • 整理 B 站技术视频为团队笔记,需要生成带章节标题和要点的 Markdown 文字稿。
  • 把 YouTube 会议录像转成可读纪要,需检测 CC 字幕并提炼原文金句。
  • 将播客长音频提取成可分发文字稿,要求按语义分段并输出微信兼容 txt。
  • 为课程视频制作复习材料,需要时间戳、要点表格和忠实原文的关键观点。

适合人员

  • 需要把技术视频沉淀为团队文档的工程师
  • 制作课程材料并要保留原文金句的内容编辑
  • 整理播客和会议录像、输出纪要的运营人员
  • 做视频研究并需要结构化转录文本的分析师