中国实时热点数据采集工具
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_8b0d9d84/hot。
技能介绍
需要解决的问题
在构建数据分析应用、舆情监控系统或内容推荐引擎时,开发者经常面临一个核心挑战:如何高效、稳定地获取中国互联网各平台的实时热度数据。手动访问微博、抖音、B站等平台并解析页面不仅耗时,还可能因网站改版或反爬策略而频繁失效。你需要一个结构化的数据源,以便将这些热度指标(如关键词、热度值)直接集成到后续的分析流程中。
技能如何工作
该技能提供了一组 Node.js 脚本,用于从指定平台实时抓取数据。其核心能力在于:
- 多维度数据采集:涵盖四大类数据源。
- crawl-hot.js:抓取抖音、微博、百度、B站、快手等平台的实时热搜榜单。
- crawl-music.js:获取QQ音乐、网易云音乐等平台的热歌榜与飙升榜。
- crawl-entertainment.js:采集猫眼电影票房、电视剧收视率及App Store应用/游戏排行。
- crawl-paper.js:获取《人民日报》电子版的版面PDF链接与高清图片。
- 统一的输出格式:所有脚本均输出结构化 JSON,字段定义清晰,例如热搜的
word(关键词)、hot_value(热度值),音乐的name(歌名)、geshou(歌手)。这使得数据消费端无需处理杂乱HTML。 - 灵活的参数化调用:通过命令行参数精确控制抓取内容。例如:
- 指定平台:node scripts/crawl-hot.js --platform=weibo
- 指定类型:node scripts/crawl-entertainment.js --type=movie
- 指定日期:node scripts/crawl-paper.js --date=2025-03-20
关键步骤是在技能安装目录下,根据用户意图(如“看看今日微博热搜”)选择对应的脚本与参数组合,执行 node 命令,解析返回的 JSON 对象即可获得所需数据。
适用边界与注意点
在使用前,请注意以下技术细节:
- 运行环境:必须安装 Node.js 18+,因为脚本依赖内置的
fetchAPI。 - 数据实时性与稳定性:数据直接采集自上游平台,响应时间约为1-3秒。快手平台的热搜接口偶尔可能不稳定,返回空数据。
- 工作目录:执行脚本时,当前工作目录应为该技能的根目录,以确保脚本内相对路径引用正确。
- 无密钥要求:所有抓取功能无需申请或配置任何 API Key,开箱即用。
- 输出处理:返回的 JSON 包含直接可用的字段(如报纸版面的
image_url),可直接用于 Markdown 图片渲染或进一步数据分析。
使用场景
- 当产品经理需要评估新功能上线后的市场反响时,运行`crawl-hot.js`脚本获取抖音和微博的实时热搜数据,分析用户讨论焦点,为迭代提供数据支撑。
- 音乐版权采购团队在谈判前,使用`crawl-music.js`采集QQ音乐和网易云的热歌榜,量化歌曲热度,辅助判断版权价值与市场需求。
- 影视项目投资分析师通过`crawl-entertainment.js --type=movie`获取猫眼实时票房和排片数据,制作竞品分析报告,评估投资风险。
- 新闻传播学研究者为对比媒体议程设置,使用`crawl-paper.js --date=2025-03-20`获取指定日期《人民日报》版面高清图,进行内容分析与归档。
适合人员
- 舆情分析师:每日需监控多平台热点事件,使用技能批量抓取热搜数据,生成舆情简报,及时预警负面信息。
- 社交媒体内容策划:负责制造爆款话题,依赖技能获取B站、快手等平台实时热门榜单,快速锁定创作灵感和切入点。
- 娱乐行业数据专员:定期收集电影票房、电视剧收视率和游戏排行,使用技能整合多源数据,更新公司内部数据库。
- 数字图书馆管理员:需要系统化归档中国主要报纸电子版,使用技能批量获取《人民日报》历史版面PDF链接和图片,构建可检索的新闻资料库。