视频转文本转录
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_fe8721be/video-to-md。
技能介绍
问题
视频内容通常分散在 URL、本地文件和不同平台里,工程师需要快速得到可检索文本。这个技能解决的问题是:把 bilibili.com、YouTube、TikTok/Douyin、Twitter/X 等 yt-dlp 可支持来源,以及本地 mp4、wav、m4a、webm、mkv 等文件,转换成文字转录。
工作方式
它依赖 yt-dlp 获取媒体、ffmpeg 处理音频、faster-whisper 做语音识别,并可通过参数控制模型与输出:
url:视频 URL 或本地文件路径-m, --model:选择tiny、base、small、medium、large-l, --language:指定语言,默认自动检测-o, --output:写入文件或打印终端--keep-files:保留下载的音视频文件
Bilibili 内容需要 SESSDATA、bili_jct、buvid3 等认证信息,可通过配置或命令参数提供。注意这些是登录凭证,不要分享;tiny/base 适合快速草稿,medium/large 识别更准但更慢,适合最终稿。
使用场景
- 把 Bilibili 课程视频导出为文字稿,供团队检索并整理成会议纪要。
- 将本地 mp4 访谈录音转成可搜索文本,便于人工校对和引用定位。
- 对 YouTube 技术分享视频使用 medium 模型生成转录文件,供文档归档。
- 把 TikTok 短视频指定为英文转录,输出到指定目录用于素材整理。
适合人员
- 需要把课程视频转成文字稿并整理的知识运营人员
- 负责技术文档归档、要从技术分享视频中提取要点的工程编辑
- 维护多平台素材库、需要把短视频口播转成可检索文本的内容工程师
- 调试语音识别流程、要用本地视频文件验证 Whisper 模型效果的算法工程师