视频文字稿提取方法
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @efficient-technology/video-transcript-method。
技能介绍
问题
视频中的核心信息通常在语音里,但工程师拿到 B 站、YouTube 或播客链接后,仍要手工判断是否有 CC 字幕、下载音频、跑 Whisper、整理分段和要点。缺少统一流程时,结果容易混入重复语气词、机械按时长切段,或把要点总结成非原意内容。
技能如何工作
本技能把视频文字稿提取拆成三条主线:
- 字幕优先:先解析 URL、识别平台和视频 ID,再用
yt-dlp --list-subs检测 CC 字幕;有中文字幕时直接取字幕,避免不必要的语音识别。 - Whisper 兜底:无字幕时下载
mp3音频轨,调用 Whisper 生成带时间戳文本;默认medium模型,FP16 不可用时降级 FP32。 - 语义整理:按内容逻辑分段,生成章节标题、时间范围、要点表格和原文金句,输出
.txt或.md。
适用边界
它适合任何 yt-dlp 支持且语音承载核心信息的在线视频;弹幕不等于 CC 字幕,未登录或平台限制可能影响字幕获取。Whisper 准确率受音频质量影响,提取内容仍需检查版权、完整性和时间戳误差。
使用场景
- 整理 B 站技术视频为团队笔记,需要生成带章节标题和要点的 Markdown 文字稿。
- 把 YouTube 会议录像转成可读纪要,需检测 CC 字幕并提炼原文金句。
- 将播客长音频提取成可分发文字稿,要求按语义分段并输出微信兼容 txt。
- 为课程视频制作复习材料,需要时间戳、要点表格和忠实原文的关键观点。
适合人员
- 需要把技术视频沉淀为团队文档的工程师
- 制作课程材料并要保留原文金句的内容编辑
- 整理播客和会议录像、输出纪要的运营人员
- 做视频研究并需要结构化转录文本的分析师