多模态数据源转换引擎
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_317b55bd/source-to-markdown。
技能介绍
适用场景
这个技能解决的是“原始资料无法直接交给后续流程”的问题:需求、录音、截图、扫描件、表格导出、网页归档和压缩包混在一起,人工整理费时,且大模型容易顺手做摘要、归类或生成建议。source-to-markdown 只负责把输入转成文本,不做需求分析、产品范围、假设抽取、摘要、推荐或交接生成,适合把原始证据尽量原样保留。
工作方式
它按文件类型路由:md、txt 直接读取并规范化;docx、pdf、pptx、xlsx、csv、html、json、xml 走 MarkItDown;图片默认使用腾讯 OCR,视觉布局不足时回退到视觉 LLM;音频默认使用腾讯 ASR,必要时回退到 LLM 音频识别;zip 会展开包内文件并写 manifest.md。输出遵循命名规则:文档和结构化导出使用 .md,OCR、ASR 和 LLM 转录使用 .raw.md。不确定内容标记为 [无法识别] 或 [听不清],不补写缺失文本。
边界与注意
它不默认支持视频、YouTube 链接、EPUB 或任意二进制文件;遇到失败会记录错误并提示换用更清晰的源文件。配置中的 API 凭据保存在 providers.json,不应粘贴到聊天、日志或转换结果中。使用这个技能时,目标是得到可核对的原文文本,而不是分析结论。
使用场景
- 整理客户提供的 PDF 扫描件、DOCX 和 CSV 时,把它们统一转成 Markdown 供后续检索或审阅。
- 把会议录音、通话 MP3 和 M4A 转成可核对的转写文本,只保留识别结果,不生成摘要或行动项。
- 处理产品资料 ZIP 包中的截图、网页 HTML、Excel 和笔记,批量输出 Markdown 并记录 manifest。
- 把扫描 PDF 页面和手机截图做 OCR,无法识别处标记为 [无法识别],避免后续引用错误内容。
适合人员
- 负责把客户交付物、录音和截图整理成可检索文本的产品助理。
- 需要把 PDF、DOCX、CSV 和网页归档统一转 Markdown 的 RAG 数据工程师。
- 把会议录音和电话录音转成原文文本、不想要自动摘要的运营或项目负责人。
- 需要批量处理 ZIP 资料包并保留每个文件转换状态的法务或咨询助理。