网页内容提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bb5d057c/web-content-extraction。
技能介绍
解决的问题
把公众号、知乎、API 文档或 skills.sh 链接交给助手后,难点通常不是打开页面,而是把正文从导航、懒加载媒体、反爬壳和动态 UI 中分离出来。web-content-extraction 将 URL 作为输入,输出可用于分析、总结或翻译的 Markdown 文本与媒体引用。
工作方式
技能按可靠性和成本选择工具链:
- 首选路径:
web_extract提取正文为 Markdown,适合普通网页、部分公众号文章和 PDF,单次最多处理 5 个 URL。 - 发现辅助:
web_search在缺少具体链接时,用关键词或site:定位候选页面。 - 兜底路径:遇到反爬、动态渲染或登录墙时,用
browser_extract通过browser_navigate和browser_snapshot读取页面。
针对微信公众号,资料特别提示:web_extract 连续失败可能是配额耗尽,不是网站故障。更可靠的方式是运行 scripts/fetch_weixin.sh,用 curl 抓取 HTML,再从 js_content 区域解析正文、作者、图片 data-src 和媒体列表。若用户只给关键词,则走搜狗微信搜索流程,先解析真实 URL,再提取全文。
适用边界
这是以文本为主的提取能力:正文文字和图片 URL 通常可恢复,视频、音频和纯图片内容可能依赖 JS 或懒加载。搜狗搜索可能限流,真实 URL 解析也可能偶发失败;登录后可见内容、需要拆分的大 PDF 不在覆盖范围内。提取结果只用于当前对话,不写入持久记忆。
使用场景
- 把公众号链接交给助手,提取正文和作者,生成 3-5 句摘要供竞品分析。
- 根据关键词检索搜狗微信文章,解析真实 URL 后提取全文,追踪热点选题。
- 读取 API 文档或 skills.sh 页面,输出 Markdown 正文,便于对比接口字段。
- 当 web_extract 被反爬挡住时,切换到浏览器快照读取动态页面内容。
适合人员
- 做竞品公众号分析的运营,需要把指定链接正文提取成 Markdown 后做摘要对比。
- 追踪行业热点的内容编辑,需要按关键词搜微信文章并拉取全文作为选题参考。
- 维护 Agent 工具链的工程师,需要把网页正文稳定转成可分析文本,减少动态页面干扰。
- 整理技术文档的研究员,需要读取 API 文档或技能市场页面,生成结构化要点。