全能金融爬虫(优化爬取逻辑,新增语音交互)
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_9d5a2a39/cnfinancialscraper。
技能介绍
在金融数据领域,分析师和开发者常需从分散的媒体、公告、行情接口中获取实时信息,但面临数据源不统一、反爬机制严格(如验证码、IP封禁)、动态页面渲染复杂等挑战。手动处理这些任务不仅耗时,还容易因爬虫失败而遗漏关键数据。全能金融爬虫通过优化爬取逻辑和新增语音交互,为这类问题提供了自动化解决方案。
核心能力与工作原理
该工具以零依赖核心为基础,支持多模块覆盖。关键能力包括:
- 全网舆情监控:通过
crawl_global_sentiment爬取 60+ 商业财经媒体源和 RSS,结合情感分析与去重,生成结构化快照。 - 智能多级爬取:实现 API→HTTP→浏览器的降级链(如
batch_smart_crawl),自动处理反爬,包括验证码人工接管和代理轮换。 - 内容识别与提取:使用
smart_extract识别网页中的表格、键值块和金融数字,无需额外依赖。 - 语音交互:通过
run_voice.py支持语音输入触发爬取,适合快速查询。
操作上,用户可通过自然语言对话触发功能,例如输入“爬某公司最近7天舆情”调用 crawl_global_sentiment;对于动态页面,使用 browser_human_fetch 模拟类人操作(如阅读停顿、滚动)。风险指标分析通过 analyze_risk_metrics 计算年化波动、夏普比率等。
适用场景与注意事项
该工具适用于公开金融数据爬取,支持机构名单查询、行情获取、研报搜索等场景。但需注意其能力边界:
- 完全支持:机构名单、舆情监控、批量爬取、文档解析(PDF/Word)、风险分析。
- 不支持:需登录的页面(如微信公众号后台)、付费墙内容(如Wind数据)、实时WebSocket推送。
- 部分支持:动态渲染页面(需Playwright)、反爬严格的网站(如银行官网,成功率30-50%)。
预期成功率因目标而异,例如天天基金达95%+,但银行官网仅30-50%。依赖层级分层:核心功能零依赖,浏览器和akshare需额外安装。
使用场景
- 作为证券研究员,需要从60多个财经媒体源爬取某上市公司最近7天的舆情数据,并自动进行情感分析,以评估市场对其财报发布后的反应。
- 在投资组合管理中,需定期查询包含2301家金融机构的名单库,获取其官网和业务信息,用于合规审查和合作伙伴筛选。
- 处理银行官网等反爬严格的网站时,使用浏览器爬取模块模拟人类滚动和停顿行为,成功获取被验证码保护的公告PDF内容。
- 通过语音输入命令快速启动舆情快照分析,无需手动编写脚本,适合交易员在会议中即时获取突发新闻的汇总报告。
适合人员
- 金融市场分析师,需每周汇总多家公司的舆情趋势,生成风险评估报告供投资决策参考。
- 量化交易开发者,需实时获取A股、期货等结构化行情数据,并计算年化波动和夏普比率,用于策略回测。
- 金融合规专员,需批量爬取券商研报和监管公告,确保公司业务操作符合最新行业法规。
- 个人基金投资者,通过语音交互快速查询特定基金的风险指标和业绩解读,辅助投资选择。