ab-test-analysis
对 A/B 测试结果进行分析,包括统计显著性、样本量验证、置信区间,以及给出上线/延长/停止的建议。适用于评估实验结果、检查测试是否达到显著性、解读分流测试数据或决定是否上线某一变体。
作者
分类
产品设计安装
热度:67
下载并解压到你的 skills 目录
复制命令,发送给智能体自动安装:
下载并安装这个技能 https://openskills.cc/api/download?slug=phuryn-pm-data-analytics-skills-ab-test-analysis&locale=zh&source=copy
A/B 测试分析 - ab-test-analysis
技能概述
使用统计严谨的方法评估 A/B 测试结果,提供显著性检验、样本量验证、置信区间计算和上线/延期/停止决策建议。
适用场景
1. 评估实验结果,判断是否达到统计显著性
当你完成一次 A/B 测试后,需要客观判断实验组和对照组之间的差异是否真实存在,还是仅仅由随机波动造成。本技能帮你计算 p 值、置信区间,并给出是否具有统计显著性的明确结论,避免凭直觉或运气做决策。
2. 验证实验设计的合理性
在查看实验结果之前,先检查实验是否跑够了时间、样本量是否充足、是否存在样本比例不匹配等问题。本技能会根据统计学公式评估实验功效,指出测试是否设计不足(如功效低于 80%),防止因为实验本身的问题导致结论不可靠。
3. 解读分流测试数据,制定产品决策
面对多组实验数据、多个指标(核心指标 + 护栏指标),需要综合判断是否应该全量发布、继续观察还是放弃上线。本技能不仅计算统计指标,还结合业务意义给出 Ship / Extend / Stop / Investigate 的明确建议,并解释原因和下一步行动。
核心功能
1. 统计显著性检验
计算对照组和实验组的转化率、相对提升幅度、p 值(双尾 z 检验或卡方检验)以及 95% 置信区间,明确回答"差异是否统计显著"这一核心问题。如果你提供原始数据文件(CSV、Excel 或分析平台导出),本技能可以生成并运行 Python 脚本进行精确计算,而不依赖手工估算。
2. 样本量与实验设计验证
使用统计学公式 n = (Z²α/2 × 2 × p × (1-p)) / MDE² 评估当前样本量是否足以检测到预期效应,计算实验功效是否达到 80% 标准。同时检查实验时长是否覆盖 1-2 个完整业务周期、是否存在样本比例不匹配(SRM)、新奇效应是否已淡化,确保实验结论的有效性。
3. 综合决策建议
基于统计显著性、实际业务意义和护栏指标表现,给出 Ship / Extend / Stop / Investigate 的明确建议,并解释原因和后续行动。不仅回答"是否有显著差异",更回答"是否应该上线",帮助产品团队做出数据驱动的产品决策。
常见问题
A/B 测试需要多少样本量才可靠?
样本量取决于你希望检测到的最小效应(MDE)、当前转化率和统计显著性水平。使用公式 n = (Z²α/2 × 2 × p × (1-p)) / MDE² 计算,确保功效达到 80% 以上。如果样本量不足,即使看到"正向趋势"也可能只是随机波动,此时应延长测试或接受无法得出结论的现实。
p 值小于 0.05 就可以上线吗?
不一定。p < 0.05 说明差异统计显著,但还需要检查:提升幅度是否具有实际业务意义(如转化率从 5% 提升到 5.1%,虽然显著但可能不值得上线);护栏指标(如收入、参与度、加载时间)是否没有恶化;实验是否跑够时间消除了新奇效应。本技能会综合这些因素给出 Ship / Investigate 等建议。
实验没有显著差异但趋势向好怎么办?
如果 p > 0.05 但方向正确,可能是因为样本量不足或真实效应较小。此时不建议立即上线,应考虑延长测试以收集更多数据,或接受当前效应太小不值得投入。如果趋势平坦(无明显方向),则应停止测试,节省资源。本技能会根据功效分析和趋势方向给出 Extend 或 Stop 的明确建议。