Agent Skills
返回列表
中文网页正文提取器

中文网页正文提取器

教育学习 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_15292d5a/yjkj-cn-readability-extractor

技能介绍

为什么需要正文提取

很多爬虫或阅读流处理网页时,真正有用的信息只占页面的一小段:其余是导航、侧边栏、广告、脚本和模板噪音。直接抓取 HTML 会导致下游摘要、问答或训练数据被无关内容污染。cn-readability-extractor 把 URL 作为输入,目标是只返回相对干净的正文、标题和描述,适合做内容清洗的第一道工序。

能力与工作方式

  • 输入:一个网页 URL,由 urllib 发起请求。
  • 解析:使用 Python 标准库 html.parser 遍历文档,不依赖重型浏览器或第三方解析栈。
  • 清洗:去除广告、导航、脚本等常见非正文元素,降低模板噪音。
  • 输出:保留可读正文,并尽量抽取页面 标题 和 描述,支持中英文内容。
  • 运行环境:Python 3.7+,仅使用标准库,便于在轻量服务、教学脚本或受限沙箱中接入。

适用边界

它解决的是“从页面里取出正文”的问题,不是通用搜索引擎、不是完整浏览器自动化,也不保证对高度动态渲染、登录态、反爬严格的站点有稳定结果。遇到 JavaScript 渲染后的内容、Cookie 权限或验证码,需要上游先准备可访问资源。输出质量取决于页面结构,复杂模板仍可能需要规则微调。

使用场景

  • 把中文教程页面里的正文抽出来,去除侧边栏和广告,再交给摘要模型。
  • 清洗英文新闻页面,保留文章主体与标题描述,便于做问答检索索引。
  • 从多个产品文档页提取可读正文,生成统一的内容片段用于内部知识库。
  • 在轻量 Python 脚本里抓取网页正文,不引入浏览器或重型解析依赖。

适合人员

  • 需要把网页正文变成干净语料的爬虫工程师。
  • 做 RAG 文档预处理、需要抽取文章标题与正文的算法工程师。
  • 用 Python 脚本整理中英文网页内容的技术写作者。
  • 在受限环境里做内容清洗、不想引入额外依赖的后端工程师。