Agent Skills
返回列表
购物场景 Agent 体验评估

购物场景 Agent 体验评估

AI Agent 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,将 @user_d9b3e84b/shopping-agent-evaluation 安装到 AI 助手中。

技能介绍

要解决的问题

线上购物助手看似能答商品推荐、价格、预算、品牌偏好等问题,但实际体验往往依赖单条对话观感。要比较 豆包 和 通义千问 在真实购物场景中的表现,需要一套可重复、可量化、可留档的评估方法。

技能如何工作

  • 查询生成:调用 DeepSeek 生成 30 条覆盖 11 类购物场景的用户查询,包括具体商品、预算约束、品牌偏好、功能要求、模糊需求、矛盾需求等。
  • 模型回答:让 doubao-seed-2-0-pro 与 qwen-plus 分别以电商购物助手角色回答全部查询。
  • 专家评分:由 DeepSeek 按 7 分制从 11 个维度评分,如商品相关性、推荐理由说服力、价格合理性、事实性、交互自然度,并输出综合评语。
  • 报告交付:生成带环形图与雷达图的 DOCX 报告,以及包含查询、回答、评分和统计汇总的 XLSX 文件。

适用边界与注意点

该技能更适合用于横评购物助手体验,不是生产级推荐系统压测。API 调用次数较多,运行约 15–30 分钟,需要提前配置 DEEPSEEK_API_KEY、DOUBAO_API_KEY、QWEN_API_KEY。评分结果反映的是给定查询集与评分提示词下的表现,若要用于选型,建议结合真实业务数据复核。

使用场景

  • 在候选豆包和千问接入电商导购前,用30条购物查询对比两者回答并出11维度评分报告。
  • 需要把购物助手评测结果整理成带雷达图、环形图和优劣势分析的DOCX汇报材料。
  • 检查AI导购在预算、品牌偏好、模糊需求等场景下是否跑题、不安全或解释不足。
  • 把模型回答、逐条11维度评分、成功率与出错原因导出到XLSX做后续复核。

适合人员

  • 负责AI导购产品验收、要比较豆包与千问回答质量的产品经理
  • 需要把电商助手横评结果做成管理层DOCX报告的算法评测工程师
  • 维护购物助手提示词、要定位推荐理由弱和事实性差的Prompt工程师
  • 做电商AI供应商比选、要留档评分明细和出错统计的技术负责人