Agent Skills
返回列表
网页内容提取

网页内容提取

知识管理 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_bb5d057c/web-content-extraction。

技能介绍

解决的问题

把公众号、知乎、API 文档或 skills.sh 链接交给助手后,难点通常不是打开页面,而是把正文从导航、懒加载媒体、反爬壳和动态 UI 中分离出来。web-content-extraction 将 URL 作为输入,输出可用于分析、总结或翻译的 Markdown 文本与媒体引用。

工作方式

技能按可靠性和成本选择工具链:

  • 首选路径:web_extract 提取正文为 Markdown,适合普通网页、部分公众号文章和 PDF,单次最多处理 5 个 URL。
  • 发现辅助:web_search 在缺少具体链接时,用关键词或 site: 定位候选页面。
  • 兜底路径:遇到反爬、动态渲染或登录墙时,用 browser_extract 通过 browser_navigate 和 browser_snapshot 读取页面。

针对微信公众号,资料特别提示:web_extract 连续失败可能是配额耗尽,不是网站故障。更可靠的方式是运行 scripts/fetch_weixin.sh,用 curl 抓取 HTML,再从 js_content 区域解析正文、作者、图片 data-src 和媒体列表。若用户只给关键词,则走搜狗微信搜索流程,先解析真实 URL,再提取全文。

适用边界

这是以文本为主的提取能力:正文文字和图片 URL 通常可恢复,视频、音频和纯图片内容可能依赖 JS 或懒加载。搜狗搜索可能限流,真实 URL 解析也可能偶发失败;登录后可见内容、需要拆分的大 PDF 不在覆盖范围内。提取结果只用于当前对话,不写入持久记忆。

使用场景

  • 把公众号链接交给助手,提取正文和作者,生成 3-5 句摘要供竞品分析。
  • 根据关键词检索搜狗微信文章,解析真实 URL 后提取全文,追踪热点选题。
  • 读取 API 文档或 skills.sh 页面,输出 Markdown 正文,便于对比接口字段。
  • 当 web_extract 被反爬挡住时,切换到浏览器快照读取动态页面内容。

适合人员

  • 做竞品公众号分析的运营,需要把指定链接正文提取成 Markdown 后做摘要对比。
  • 追踪行业热点的内容编辑,需要按关键词搜微信文章并拉取全文作为选题参考。
  • 维护 Agent 工具链的工程师,需要把网页正文稳定转成可分析文本,减少动态页面干扰。
  • 整理技术文档的研究员,需要读取 API 文档或技能市场页面,生成结构化要点。