Agent Skills
返回列表
B站视频转文字稿

B站视频转文字稿

设计多媒体 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_0b65fce7/bilibili-txt。

技能介绍

解决什么问题

B站视频里的口播、教程和访谈内容常只以音频形式存在。想沉淀为可检索的笔记、摘要或脚本时,手动听写既慢又容易遗漏。部分视频虽有 CC 字幕,但可能需要登录 Cookie;弹幕也不是正文。没有字幕时,缺少稳定的“音频转文字”路径。该技能将流程固定为:从视频 URL 出发,优先取可用字幕,否则语音识别,最后输出结构化文字稿。

工作流与能力

核心能力是从 B站视频 URL 提取文字稿。先用 yt-dlp 下载音频轨;高画质或会员限制通常不影响音频获取。随后检查 zh-Hans、zh 等非弹幕 CC 字幕,若存在则优先使用,降低识别成本。否则调用 OpenAI Whisper 做中文识别,可指定 tiny、base、small、medium、large 模型;默认 medium 兼顾中文效果与速度,large 适合长视频或更高精度。转录后读取标题、UP主、播放量等元信息,并整理为 .txt 文字稿:按内容分节、添加章节标题、提炼要点表格、摘录关键结论,并保留 [MM:SS] 时间戳,便于回看原视频。

边界与注意

它更适合音频内容提取,而不是视频画面理解。弹幕不能替代口播稿;CC 字幕可能受登录状态影响。Whisper 在 CPU 上可能出现 FP16 警告并自动降级为 FP32,一般不影响结果。网络存在 SSL 证书问题时,脚本已内置绕过处理。模型越大质量通常越好,但下载体积和推理耗时更高;短内容可选小模型快速预览。

使用场景

  • 复盘 B站教程视频时,把口播内容转为带时间戳的笔记,便于定位原视频重点。
  • 整理访谈播客时,提取嘉宾观点、章节标题和关键结论,形成可编辑的文字稿。
  • 沉淀产品讲解或课程视频,把音频转录成结构化 .txt,用于后续摘要和检索。
  • 在无法手动打字时,优先读取 CC 字幕或用 Whisper 生成中文字幕式文字稿。

适合人员

  • 需要把 B站口播教程转成可检索笔记的内容编辑
  • 整理访谈视频观点与结论的播客制作人
  • 把课程讲解沉淀为文字资料并回看原视频的自学者
  • 需要中文语音转文字稿且偏好 .txt 输出的技术文档作者