Scrapling 策略工具箱
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_19a6d235/scrapling-fetcher-plus。
技能介绍
面向真实抓取任务
网站结构频繁变化、静态页面、JS 渲染、Cloudflare 验证、分页列表和登录态页面混在一起时,直接写一次性脚本常常需要反复维护选择器、处理等待条件,再手工转成团队需要的文档或表格。Scrapling 策略工具箱 把这类任务拆成可复用的策略模板:先按目标类型选择 Fetcher、DynamicFetcher、StealthyFetcher 或 Spider,再使用 ::text、::attr(name)、:contains('...')、XPath 与正则回退提取字段,最后将结果路由到 CSV、JSON、Excel、企微、飞书、钉钉或 IMA。
工作方式与边界
该技能强调“先确认,再执行”:每次任务需要明确目标 URL、是否需要 JS 渲染、是否存在 Cloudflare、提取哪些字段以及输出到哪里。静态抓取适合公开 API、新闻、文档站;动态渲染适合 SPA 和等待网络空闲的页面;StealthyFetcher 面向 Cloudflare Turnstile 等更强反爬;Spider 适合商品列表、搜索结果等需要并发、延迟和断点恢复的场景。注意:浏览器模式依赖 Playwright 与 Chromium;路由到企业平台通常需要相应凭证或外部 CLI/Skill;选择器仍会随前端改版失效,建议保留 OUTPUT_SCHEMA 与预览步骤,避免把临时脚本直接写死。
使用场景
- 抓取公开文档或新闻页的标题、正文与链接,按字段导出 CSV/Excel。
- 抓取 SPA 商品价格或状态,等待指定选择器或网络空闲,再写入飞书多维表格。
- 绕过 Cloudflare/Turnstile 验证页抓取受保护内容,整理后上传 IMA 知识库。
- 分页爬取商品列表或搜索结果,控制并发、延迟与断点恢复,汇总进企微智能表格。
适合人员
- 维护站点监控脚本的数据工程师:希望用模板减少选择器反复改写。
- 把外部网页信息归档进企业知识库的运营:需要结构化提取并上传 IMA 或企微文档。
- 抓取动态商品或价格并同步到在线表格的产品/分析师:需要等待 JS 渲染并路由飞书或企微。
- 需要绕过 Cloudflare 抓取公开内容的研究/爬虫工程师:希望复用 StealthyFetcher 参数模板。