网页搜索与内容提取
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @user_6ed39544/web34。
技能介绍
要解决的问题
智能体在做研究、RAG、事实核查时,不能只依赖模型内部知识。需要把网页检索、正文抽取和来源聚合拆成稳定步骤:先找到相关页面,再把 URL 内容变成可分析的文本,最后交给 LLM 做总结、校验或生成答案。web34 针对这个流程,把 Tavily 与 Exa 的搜索、回答、抽取能力接入 inference.sh CLI。
技能如何工作
核心能力包括:
- Tavily Search:调用
tavily/search-assistant,返回带来源和图像的 AI 生成答案。 - Tavily Extract:调用
tavily/extract,从多个 URL 中提取干净文本与图像。 - Exa Search:调用
exa/search,返回带上下文的高相关链接。 - Exa Answer:调用
exa/answer,获取直接的事实型回答。 - Exa Extract:调用
exa/extract,对网页内容做提取与分析。
关键步骤通常是:用搜索应用定位主题相关页面,用 Extract 应用读取 URL 正文,再让 LLM 做摘要、对比或生成 RAG 上下文。技能强调预置工具集成,减少把搜索 API 手工串入 agent 的成本。
适用边界
适合研究、事实核查、内容聚合和构建研究型 agent。不适用于需要实时交易数据、登录态页面抓取、大规模爬虫或严格法律合规校验的场景。使用前需已有 inference.sh CLI(infsh)环境,并且各 App 的实际可用性受对应后端服务与配置影响。
截图预览
使用场景
- 为调研报告先检索多个网页来源,再提取正文交给模型总结
- 在 RAG 流程里根据问题检索相关文档,抽取 URL 内容构建上下文
- 核对新闻声明时搜索多个来源并提取原文片段做交叉验证
- 聚合竞品发布页内容,提取关键信息用于生成周报
适合人员
- 构建研究型智能体的工程师:需要给 agent 加入可引用网页搜索和正文提取步骤
- 做 RAG 应用的开发者:需要把外部网页资料转成模型可用的上下文
- 内容运营:需要聚合多个来源页面并提取关键信息生成摘要
- 事实核查编辑:需要快速检索声明来源并提取原文证据
