Agent Skills
返回列表
Python 爬虫开发引导

Python 爬虫开发引导

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_5548e881/python-crawler-guide 到当前 AI 助手。

技能介绍

要解决的问题

非技术用户常说“帮我写个爬虫”,但真正难的是把目标网站、字段、频率和合规说清楚,并拿到能长期跑、可验收、不出安全问题的项目。这个技能把这类请求转成明确流程,避免一次性脚本式回答,也不把简单 requests.get() 问题过度复杂化。

技能如何工作

技能先做冷启动判断:检查工作区是否有 requirements.txt、crawler.py、config.yaml、db.py,再决定新建还是审计。开发模式会先检查 Python 版本和现有代码冲突,比如 Flask/FastAPI、SQLite/PostgreSQL、密钥硬编码;若用户说“你来决定”,会先声明合理假设再继续。随后按场景选型:静态页用 requests + BeautifulSoup,动态页用 Playwright,大规模任务才考虑 Scrapy。它会强制一组开发契约:timeout、retry、逐条异常、反爬限速、robots.txt、配置分离、断点续爬、生成器处理、RotatingFileHandler 日志轮转和统一错误返回。存储默认更轻:文档存 Markdown,表格存 Excel,只有用户明确要求时才接 MySQL/PostgreSQL,并要求连接池、参数化查询、upsert 去重。交付前会用验收清单和 33 项审计门控。

适用边界

它不适合单个静态页面的一次性读取、通用 Python 调试、本地 HTML 文件解析,或用户已指定 Apify 等专用工具。技能有强文件安全规则:不删用户文件,覆盖同名文件前必须确认,修改范围限定当前项目,不顺手重构无关代码。遇到封禁、JS 渲染、定时运行等瓶颈时,先推荐 Playwright、cron、systemd 等免费方案,付费方案只作最后兜底。

使用场景

  • 当需要每周抓取公开商品页价格、名称并生成本地 Excel 文件时。
  • 当想审查现有 Python 爬虫是否有硬编码密码、日志无轮转和请求失控时。
  • 当需要给已有爬虫加配置界面、启动停止按钮和实时日志查看时。
  • 当爬虫遇到 JS 渲染或封禁,需要先用本地 Playwright 与限速方案处理时。

适合人员

  • 非技术运营:只想用大白话说明抓取字段和频率,不需要自己选框架。
  • 数据分析师:需要把公开网站数据落到 Excel 或数据库,并定期更新。
  • 项目维护者:想审查爬虫的凭据、日志轮转、异常处理和合规风险。
  • 独立开发者:需要规范化新建爬虫的连接池、断点续爬和验收清单。