文档网页智能总结
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_7eecc4ea/summarize-new 到你的 AI 助手中。
技能介绍
要解决的问题
长文档、网页正文和 PDF 常混入导航、广告、目录与噪声,直接交给模型总结容易遗漏重点或被格式干扰。Document Summarize 针对这类场景,先抽取可读正文,再按固定维度分析,最后输出可复用的结构化摘要。
工作方式
- 网页:通过
WebFetch获取 HTML,再用scripts/clean_html.py清洗非正文内容。 - 文件:
PDF走scripts/extract_pdf.py,MD和TXT可直接读取;对话中的大段文本和代码片段也可直接分析。 - 分析维度:识别主题、章节结构、关键实体、核心观点、数据事实与行动项。
- 输出:依据长度生成执行摘要、分章节要点、结论与推荐阅读;短内容压缩为一句概要和核心要点。
适用边界
该技能依赖可读取的文本内容,无法处理纯图片、视频或登录保护页面。PDF 提取可能需要 pypdf,失败时应转成文本或 Markdown。摘要强调忠实原文,不做外部推断;内容过短会直接标注无需总结。
使用场景
- 收到竞品发布网页后,快速提取正文、核心观点和数据,输出评审用摘要。
- 把客户发来的合同 PDF 转成文本后,提炼条款、金额、日期与待办事项。
- 粘贴长篇技术博客或论文片段,要求按章节、实体、结论生成可读摘要。
- 排查 URL 内容时,只读取正文并排除导航广告,便于做内容入库判断。
适合人员
- 整理网页素材的内容编辑:需要从新闻页提取正文、核心观点和可引用数据。
- 处理合同与报告的法务助理:要把 PDF 条款、金额、日期和待办事项提炼成审阅摘要。
- 跟踪技术资料的工程师:希望把长文、论文或 API 文档压缩成章节要点和关键实体。
- 做知识入库的平台运营:需要判断网页正文是否可用,并提取主题、事实与行动项。