Agent Skills
返回列表
视频转文本转录

视频转文本转录

设计多媒体 更新于 2026.08.29

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_fe8721be/video-to-md。

技能介绍

问题

视频内容通常分散在 URL、本地文件和不同平台里,工程师需要快速得到可检索文本。这个技能解决的问题是:把 bilibili.com、YouTube、TikTok/Douyin、Twitter/X 等 yt-dlp 可支持来源,以及本地 mp4、wav、m4a、webm、mkv 等文件,转换成文字转录。

工作方式

它依赖 yt-dlp 获取媒体、ffmpeg 处理音频、faster-whisper 做语音识别,并可通过参数控制模型与输出:

  • url:视频 URL 或本地文件路径
  • -m, --model:选择 tiny、base、small、medium、large
  • -l, --language:指定语言,默认自动检测
  • -o, --output:写入文件或打印终端
  • --keep-files:保留下载的音视频文件

Bilibili 内容需要 SESSDATA、bili_jct、buvid3 等认证信息,可通过配置或命令参数提供。注意这些是登录凭证,不要分享;tiny/base 适合快速草稿,medium/large 识别更准但更慢,适合最终稿。

使用场景

  • 把 Bilibili 课程视频导出为文字稿,供团队检索并整理成会议纪要。
  • 将本地 mp4 访谈录音转成可搜索文本,便于人工校对和引用定位。
  • 对 YouTube 技术分享视频使用 medium 模型生成转录文件,供文档归档。
  • 把 TikTok 短视频指定为英文转录,输出到指定目录用于素材整理。

适合人员

  • 需要把课程视频转成文字稿并整理的知识运营人员
  • 负责技术文档归档、要从技术分享视频中提取要点的工程编辑
  • 维护多平台素材库、需要把短视频口播转成可检索文本的内容工程师
  • 调试语音识别流程、要用本地视频文件验证 Whisper 模型效果的算法工程师