A/B 测试搭建
将以下提示词粘贴到你的 AI 对话框中:
请根据 https://skillhub.cn/install/skillhub.md,安装 @org-02qudk26/ab-test-setup。
技能介绍
解决的问题
很多 A/B 测试失败不在工具,而在设计:假设模糊、一次改多个变量、样本量没算、中途偷看结果,最后只能得出“似乎有差异”。这个技能面向需要把页面、文案、定价或 CTA 改动变成可验证实验的工程与增长场景,重点是把测试从“上线看看”变成有基线、有指标、有停止条件的流程。
工作方式
- 先补上下文:如果存在
.claude/product-marketing-context.md,会优先读取,再只询问缺失的基线转化率、流量、技术约束和时间线。 - 建立假设:要求把弱描述改写成可检验的预测,例如基于用户反馈、热力图或历史数据,给出预期提升幅度和衡量路径。
- 设计测试:围绕主指标、次级指标和护栏指标选择变体;根据流量判断使用
A/B、A/B/n、MVT 或拆分 URL,并参考样本量表避免小流量下误判。 - 执行与分析:覆盖流量分配、客户端/服务端实现、发布前检查、运行期监控,以及显著性、置信区间、效应量、分群差异和护栏风险的解读。
适用边界
它适合已有明确转化路径和可埋点事件的产品实验;如果缺少基线数据、样本量太小或业务目标不清晰,它会更多是提醒而非直接给结论。也不替代统计分析工具,复杂因果推断、长期留存或跨端实验需要额外模型与数据校验。
使用场景
- 上线新定价页前,把套餐选择率、停留时长与退款率整理成主次护栏指标并确定样本量。
- 页面流量不大时,根据基线转化率和可接受检测幅度选择 A/B 或拆分 URL 并分配流量。
- 测试跑到一半时,检查埋点、分群一致性和护栏指标,避免提前停止或中途改变体。
- 分析结果显著性后,把结论拆到移动端、新用户和老用户,并归档假设、截图与决策。
适合人员
- 负责落地页 CRO 的产品经理,需要把页面改动变成有假设、指标和样本量的实验。
- 管理增长实验的数据分析师,需要复核显著性、置信区间、效应量和护栏指标。
- 前端或全栈工程师,需要判断客户端实验 SDK 或服务端分流实现是否可行。
- 运营负责人,需要在低流量下选择保守分流并记录测试结论,避免误上线。