购物场景 Agent 体验评估
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,将 @user_d9b3e84b/shopping-agent-evaluation 安装到 AI 助手中。
技能介绍
要解决的问题
线上购物助手看似能答商品推荐、价格、预算、品牌偏好等问题,但实际体验往往依赖单条对话观感。要比较 豆包 和 通义千问 在真实购物场景中的表现,需要一套可重复、可量化、可留档的评估方法。
技能如何工作
- 查询生成:调用
DeepSeek生成 30 条覆盖 11 类购物场景的用户查询,包括具体商品、预算约束、品牌偏好、功能要求、模糊需求、矛盾需求等。 - 模型回答:让
doubao-seed-2-0-pro与qwen-plus分别以电商购物助手角色回答全部查询。 - 专家评分:由
DeepSeek按 7 分制从 11 个维度评分,如商品相关性、推荐理由说服力、价格合理性、事实性、交互自然度,并输出综合评语。 - 报告交付:生成带环形图与雷达图的
DOCX报告,以及包含查询、回答、评分和统计汇总的XLSX文件。
适用边界与注意点
该技能更适合用于横评购物助手体验,不是生产级推荐系统压测。API 调用次数较多,运行约 15–30 分钟,需要提前配置 DEEPSEEK_API_KEY、DOUBAO_API_KEY、QWEN_API_KEY。评分结果反映的是给定查询集与评分提示词下的表现,若要用于选型,建议结合真实业务数据复核。
使用场景
- 在候选豆包和千问接入电商导购前,用30条购物查询对比两者回答并出11维度评分报告。
- 需要把购物助手评测结果整理成带雷达图、环形图和优劣势分析的DOCX汇报材料。
- 检查AI导购在预算、品牌偏好、模糊需求等场景下是否跑题、不安全或解释不足。
- 把模型回答、逐条11维度评分、成功率与出错原因导出到XLSX做后续复核。
适合人员
- 负责AI导购产品验收、要比较豆包与千问回答质量的产品经理
- 需要把电商助手横评结果做成管理层DOCX报告的算法评测工程师
- 维护购物助手提示词、要定位推荐理由弱和事实性差的Prompt工程师
- 做电商AI供应商比选、要留档评分明细和出错统计的技术负责人