拟人化浏览器采集·抗封禁 Agent
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_3ff3c268/stealth-browser-collector。
技能介绍
解决的问题
浏览器采集类流程经常卡在“请求行为太像脚本”上:访问节奏固定、路径过于线性、指纹与操作特征不一致,容易触发站点风控。这个技能面向拟人化浏览器采集与抗封禁场景,把采集任务包装成更接近真实用户浏览的 agent-style flow,适合需要稳定读取网页信息、又不想被简单反爬机制直接拦截的数据分析链路。它更关注采集行为本身,而不是把清洗、建模、入库全部打包。
工作方式与适用边界
- 拟人化采集:按更接近人工浏览的节奏、路径和交互方式组织请求,而不是单纯
batch fetching。 - 抗封禁:面向浏览器环境中的行为检测与访问限制,降低因固定请求模式被直接拦截的概率。
- Agent 形态:作为大模型技能接入现有数据流程,适合在采集环节承担任务编排、状态判断和结果回传。
需要注意,现有资料未说明底层浏览器、代理池、验证码处理、登录态管理或解析策略等实现细节。使用时应确认目标站点服务条款、频率限制与数据合规要求,不要把它理解为通用反检测工具。
使用场景
- 在网页数据管道中,以拟人化节奏采集公开页面信息,减少固定请求被拦截。
- 在竞品价格监控任务里,按更近人的浏览路径抓取多个商品页。
- 在舆情样本收集时,以拟人化智能体访问新闻页并记录页面结果。
- 在反爬排查场景中,把固定脚本请求替换成拟人化浏览流程后再采集。
适合人员
- 负责网页数据采集、希望降低固定请求被站点拦截的数据工程师
- 需要定期抓取竞品页面信息、关注访问行为是否像脚本的产品分析师
- 在反爬排查中要把脚本请求改成拟人化浏览流程的爬虫工程师
- 做舆情监测、需要从新闻页稳定采集内容的研究助理