网页剪藏
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-cn-web-clipper。
技能介绍
问题
很多网页分析任务的第一步,是把散落在 HTML 里的正文变成可保存、可检索的文本。直接复制正文会混入导航、广告、侧边栏和脚本片段;手工整理又难以保持一致。对于后续要做摘要、清洗或知识沉淀的场景,缺少一个稳定的网页到 Markdown 的中间步骤。
工作方式
cn-web-clipper 以网页链接为输入,把页面内容整理成本地 Markdown:
- 获取页面:依赖
Python 3.7+,通过requests请求网页,并用beautifulsoup4处理 HTML 结构。 - 提取正文与元信息:围绕标题、作者、日期等字段做识别,保留对后续分析有用的内容。
- 本地保存:将整理后的正文输出为 Markdown 文件,便于归档、检索或继续处理。
- 批量处理:支持一次传入多条 URL,按列表方式完成剪藏。
适用边界
它解决的是“网页正文提取并 Markdown 化”的问题,不包含数据库、全文检索、复杂清洗管道或数据建模能力。若页面需要登录、存在验证码、强依赖 JavaScript 动态加载,或站点结构变化较大,输出结果可能需要人工校对后再使用。
使用场景
- 整理竞品报告时,把多篇文章链接批量转成 Markdown,方便本地检索。
- 新闻监测时,提取每篇正文、标题、日期,生成统一 Markdown 存档。
- 建本地知识库前,把网页正文从 HTML 中剥离并保存为文本文件。
- 核对外部数据时,用多条 URL 批量保存网页原文,避免手动复制杂质。
适合人员
- 需要把网页资料批量转成 Markdown 的调研分析人员
- 做本地知识库或数据清洗前内容整理的工程师
- 负责竞品资讯监测并需要统一存档的运营人员
- 处理外部网页数据、要求保留标题日期等字段的分析师