抖音视频文案提取器
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_75818cbb/douyin-video-word。
技能介绍
要解决的问题
抖音视频中的口播信息常以语音形式存在,直接抓取文本并不方便。这个技能面向工程师和知识工作者,把 v.douyin.com / douyin.com 视频链接转换为可编辑的文字稿,便于归档、检索和二次加工。
技能如何工作
它围绕语音转写构建:使用 yt-dlp 获取音频流,借助 ffmpeg 完成格式处理,再用 faster-whisper 将语音转成文本。首次运行会检查依赖并缓存路径,后续启动更快。支持 --lang auto/zh/yue/en/ja/ko、--model tiny/base/small/medium、--timestamps、--output 和 --cookies 等参数。对 Whisper 常见的同音字误识别,它会结合上下文进行订正,并内置部分佛教术语校正。若遇到 403,会按音频流、格式列表和 Playback API 兜底下载。
注意点
公开视频多数可直接运行;需要登录态或限制访问时,可准备 Cookie 文件。模型精度越高,速度和资源消耗越高;粤语、方言、噪声、专业名词较多时,建议提高模型或人工复核。输出文本仍可能包含语音转写的细微误差,不宜直接作为精确引用。
使用场景
- 拿到口播视频链接后,需要快速转成文字稿并归档到知识库。
- 整理粤语/中文视频观点时,需要按语言选择模型并输出带时间轴文本。
- 遇到公开视频 403 或音频流失败时,需要脚本自动切换下载策略兜底。
- 处理限制访问内容时,需要准备 Cookie 文件并指定给提取脚本运行。
适合人员
- 需要把抖音视频口播沉淀为文字素材的内容运营
- 整理多语言视频观点并做术语校对的研究助理
- 处理受限访问视频并输出时间轴文本的知识管理员
- 需要把语音内容转为可检索文本的独立开发者