腾讯云 VITA 图像视频理解
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @tencent-adm/tencentcloud-vita。
技能介绍
解决什么问题
在 Agent 工作流里,图片说明、视频摘要、监控、新闻、带货或体育片段分析常常混用,但调用方式不一致:单图、多图、视频 URL、自定义 Prompt、流式输出都要处理,本地视频还需要先变成可访问 URL。TencentCloud VITA 将腾讯云图像与视频理解服务封装为明确脚本边界,避免 Agent 用纯文本模型臆测视觉内容。
工作方式
核心脚本 scripts/main.py 面向三类输入:单张图片、按时间顺序排列的多张图片、单个视频 URL。支持 JPG、PNG、SVG、WEBP 等图片,以及 MP4、MOV、AVI、WebM 视频;视频最长 10 分钟、最大 100MB。图片可传公开 URL 或本地路径,本地图片会转成 base64 data URL 后调用 VITA API。Prompt 优先级为:命令行 --prompt > 持久化文件 /prompt/vita_prompt.txt > 内置默认提示词。可开启 --stream 得到 SSE 文本流,也可用 --temperature、--max-tokens 控制输出风格与长度。
适用边界
--image 与 --video 互斥;远程媒体必须可公开访问。本地视频当前不直接上传,需要先用其他工具上传为 URL。脚本不提供 COS 上传能力,VITA 调用失败时只能返回明确错误,不能编造分析结果。适合把图像与视频理解接入 Agent 的工程场景,不适合作为对象存储或上传网关使用。
使用场景
- 把可访问的带货视频 URL 转成卖点摘要和口播要点
- 将新闻视频 URL 转写成事件摘要、人物和关键时间点
- 对可访问监控视频 URL 描述异常行为和关键片段
- 按顺序分析多张产品图片并输出外观变化对比
适合人员
- 需要把视频内容转成文字摘要和发布文案的内容编辑
- 要审核监控录像异常行为并输出关键片段的安防运营
- 要批量理解商品图片外观变化并整理对比的电商运营
- 要把体育片段提炼高光点和解说提纲的赛事编辑