图片爬虫
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_dfcfbf47/image-scraper。
技能介绍
问题背景
在内容创作过程中,获取高清配图是提升作品质量的关键环节。然而,手动从多个网站搜索、筛选和下载图片不仅效率低下,还难以保证图片的分辨率和风格一致性。特别是当需要大量竖图、横图或方图时,不同平台的图片来源分散,且部分平台有反爬机制,导致下载困难。
技能如何工作
图片爬虫技能旨在自动化这一流程,通过脚本从多个高质量源爬取图片。核心能力包括:
- 多来源支持:主要使用百度图片搜索,备选 Wallhaven 和 Unsplash,按优先级自动切换。
- 智能爬取:使用
baidu_image_scraper_v8.py脚本,直接从百度搜索结果的data-show-ext属性提取原图 URL(objurl),无需浏览器交互,提升稳定性。 - 尺寸预设:提供从 1080p 到 8K 的多种尺寸预设,通过命令行参数如
--ratio portrait和--z 7轻松切换,以适配不同平台需求。 - 去重与清理:内置 MD5 哈希去重,避免重复下载;支持自动清理低质量图片和重命名编号。
关键步骤包括:运行脚本指定关键词和数量,脚本自动打开浏览器页面、滚动加载、提取链接并分批下载。对于百度来源,直接提取 objurl 能有效获取来自美团、爱奇艺等 CDN 的高清原图。
适用边界与注意点
尽管该技能提供了便利,但在使用时需注意:
- 百度图片限制:需依赖
agent-browser命令,且百度链接可能过期,必须分批提取并立即下载。 - 来源质量差异:不同 CDN 的图片分辨率不一,例如百度图片中竖图可达 4K+,但部分来源如抖音需通过百度 CDN 缓存访问。
- 下载效率:大量下载(如超过 200 张)时,建议使用
--keywords多关键词模式,并调整--scroll参数以获取更多图片。 - 禁止平台:避免使用摄图网、知乎等低质量或受限来源,确保图片符合真人摄影风格。
通过合理配置,该技能能有效解决内容创作中的配图需求,但需根据实际情况调整参数以应对爬取挑战。
使用场景
- 为每周发布的公众号文章爬取 4K 横图配图,使用百度图片搜索脚本,指定 'landscape' 比例和关键词,确保图片质量达标。
- 为小红书封面获取竖图,通过 Wallhaven API 备选来源搜索 'portrait' 关键词,下载分辨率 2000px 以上的图片。
- 批量下载图片用于设计素材库,使用多关键词模式 'python scripts/baidu_image_scraper_v8.py --keywords ...' 避免数量不足,并启用 MD5 去重。
- 从已有链接文件提取图片,运行 'baidu_image_scraper_v8.py --from-file links.json' 进行批量下载和重命名,整理本地资源。
适合人员
- 社交媒体运营人员,需要为帖子快速获取高清竖图配图,避免手动搜索耗时。
- 内容创作者(如博主、视频制作者),为文章或视频寻找真人摄影风格的 4K 图片,确保视觉一致性。
- 设计师或视觉编辑,批量下载图片用于素材库,要求自动去重和重命名以节省整理时间。
- 数据分析师或报告撰写者,收集特定主题的图片用于可视化或报告插图,需要稳定来源和尺寸预设。