Agent Skills
返回列表
图片爬虫

图片爬虫

数据分析 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_dfcfbf47/image-scraper。

技能介绍

问题背景

在内容创作过程中,获取高清配图是提升作品质量的关键环节。然而,手动从多个网站搜索、筛选和下载图片不仅效率低下,还难以保证图片的分辨率和风格一致性。特别是当需要大量竖图、横图或方图时,不同平台的图片来源分散,且部分平台有反爬机制,导致下载困难。

技能如何工作

图片爬虫技能旨在自动化这一流程,通过脚本从多个高质量源爬取图片。核心能力包括:

  • 多来源支持:主要使用百度图片搜索,备选 Wallhaven 和 Unsplash,按优先级自动切换。
  • 智能爬取:使用 baidu_image_scraper_v8.py 脚本,直接从百度搜索结果的 data-show-ext 属性提取原图 URL(objurl),无需浏览器交互,提升稳定性。
  • 尺寸预设:提供从 1080p 到 8K 的多种尺寸预设,通过命令行参数如 --ratio portrait--z 7 轻松切换,以适配不同平台需求。
  • 去重与清理:内置 MD5 哈希去重,避免重复下载;支持自动清理低质量图片和重命名编号。

关键步骤包括:运行脚本指定关键词和数量,脚本自动打开浏览器页面、滚动加载、提取链接并分批下载。对于百度来源,直接提取 objurl 能有效获取来自美团、爱奇艺等 CDN 的高清原图。

适用边界与注意点

尽管该技能提供了便利,但在使用时需注意:

  • 百度图片限制:需依赖 agent-browser 命令,且百度链接可能过期,必须分批提取并立即下载。
  • 来源质量差异:不同 CDN 的图片分辨率不一,例如百度图片中竖图可达 4K+,但部分来源如抖音需通过百度 CDN 缓存访问。
  • 下载效率:大量下载(如超过 200 张)时,建议使用 --keywords 多关键词模式,并调整 --scroll 参数以获取更多图片。
  • 禁止平台:避免使用摄图网、知乎等低质量或受限来源,确保图片符合真人摄影风格。

通过合理配置,该技能能有效解决内容创作中的配图需求,但需根据实际情况调整参数以应对爬取挑战。

使用场景

  • 为每周发布的公众号文章爬取 4K 横图配图,使用百度图片搜索脚本,指定 'landscape' 比例和关键词,确保图片质量达标。
  • 为小红书封面获取竖图,通过 Wallhaven API 备选来源搜索 'portrait' 关键词,下载分辨率 2000px 以上的图片。
  • 批量下载图片用于设计素材库,使用多关键词模式 'python scripts/baidu_image_scraper_v8.py --keywords ...' 避免数量不足,并启用 MD5 去重。
  • 从已有链接文件提取图片,运行 'baidu_image_scraper_v8.py --from-file links.json' 进行批量下载和重命名,整理本地资源。

适合人员

  • 社交媒体运营人员,需要为帖子快速获取高清竖图配图,避免手动搜索耗时。
  • 内容创作者(如博主、视频制作者),为文章或视频寻找真人摄影风格的 4K 图片,确保视觉一致性。
  • 设计师或视觉编辑,批量下载图片用于素材库,要求自动去重和重命名以节省整理时间。
  • 数据分析师或报告撰写者,收集特定主题的图片用于可视化或报告插图,需要稳定来源和尺寸预设。