Agent Skills
返回列表
抖音视频文案提取

抖音视频文案提取

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6a36b82b/douyin-transcribe-lz。

技能介绍

需要解决的问题

在内容创作、数据分析和信息归档等场景中,常需要将抖音视频本地音视频文件中的语音内容转化为可编辑、可搜索的文本。手动转录不仅耗时,而且容易出错,尤其对于长视频或音质不佳的录音。此技能旨在自动化这一过程,提供从提取到结构化输出的完整流水线。

工作流程与核心能力

技能的核心流程分为两大模式,其转录与输出逻辑共享同一套脚本。

1. 抖音链接模式

  • 视频提取:当用户提供抖音分享链接或口令时,技能使用 Playwright 在无头 Chrome 浏览器中打开短链接,等待 JS 加载后从 DOM 中捕获 video.src,并下载原始视频文件。此方法无需登录,且能绕过常见的登录模态框干扰。
  • 关键优势:采用 DOM 解析而非网络拦截,确保了提取的稳定性。

2. 本地文件模式

  • 直接读取:支持用户直接指定本地音视频文件路径(绝对路径、相对路径或附件引用)。技能不会移动或复制源文件,直接读取其内容进行处理。
  • 广泛格式支持:兼容 .mp4, .mp3, .wav, .flac 等多种主流音视频格式。

通用核心步骤:Whisper 转录与 Agent 整理

  • 本地转录:使用 Whispermedium 模型(约 1.4GB,首次运行自动下载缓存)对提取或指定的媒体文件进行语音识别,生成包含时间戳的原始文本。脚本内置了模型缓存损坏的自动修复机制。
  • Agent 智能整理:转录完成后,由 Agent 自身对原始文本进行后处理。这一步不调用任何外部 LLM,严格遵守规则:

- 允许:添加必要标点、修正明显的 ASR(自动语音识别)错别字、进行语义分段。
- 禁止:删减原始内容、改写概括、添加总结或评论。确保输出文本忠实于原始语音。

  • 结构化输出:最终生成一个清晰、可读的 .md 文件,同时保留原始转录的 .txt.json 文件以供查验。

使用限制与注意事项

  • 环境依赖:需要本地拥有 Python 3.10 至 3.12 环境,并需通过 setup_env.py 脚本创建隔离的虚拟环境及安装依赖(包括 PyTorch、Whisper 等)。跨机器迁移后必须重新运行此脚本。
  • 资源占用:首次运行需下载约 4GB 的模型与依赖,并需要足够的磁盘空间(约 4GB)。
  • 内容处理边界:Agent 的整理仅限于文本润色和纠错,不进行任何内容层面的增删改,以保证信息的原始性。这是功能设计上的严格限制,而非缺陷。
  • 抖音平台动态:抖音链接的提取依赖于页面 DOM 结构,若平台前端更新可能导致提取失败,但技能会尝试自动重试和回退方案。

使用场景

  • 当需要分析竞品在抖音上的内容策略时,从一系列抖音链接中批量提取视频文案,用于复盘话语模式和热点话题。
  • 作为独立研究者,在完成田野调查后,将本地录制的 `.wav` 格式访谈音频转录为可搜索文本,以便进行质性分析编码。
  • 自媒体团队需要为已发布的抖音视频制作准确字幕,从原始视频中提取语音并整理成带时间轴的 Markdown 文稿。
  • 在合规审查场景中,需快速获取某个抖音视频的言论内容,通过提取文案辅助判断是否违反平台规则。

适合人员

  • 社交媒体运营:需要定期从抖音收集竞品视频并提取文案,以生成内容趋势分析报告。
  • 学术研究者:处理大量访谈录音,要求将本地音视频文件转为文字,用于主题分析或案例研究。
  • 本地视频博主:录制了 Vlog 或教程,希望将口头讲解转为文字稿,用于发布博客文章或优化 SEO。
  • 内容审核专员:监控用户生成内容,需快速转录抖音视频中的语音,以进行违规内容筛查。