跳转到内容

A/B 测试样本量与显著性计算器

🧪 A/B 测试计算器

科学规划测试周期,避免"过早停止"或"测试无效"的常见错误。

你目前的产品页/结账页转化率
期望 CVR 提升的相对比例(如提升 20% 表示 2.5% → 3.0%)
用于估算测试天数(A+B 两组总流量)

测试结束后,输入实际数据,计算 p-value 判断结果是否统计显著。

🅰 对照组(A)
🅱 实验组(B)

A/B 测试最大的错误不是”测错了版本”,而是不科学的测试流程

  • ❌ 没有计算样本量就开始测,“感觉差不多了”就停
  • ❌ 每天查看结果,一看到 B 组领先就立刻停止(Peeking 效应
  • ❌ 样本量太小,随机波动被误认为”有效提升”

第一步:提出假设

“将产品页主图改为模特使用场景图,预期可以提升转化率 20%(从 2.5% → 3.0%)”

假设必须包含:测试变量(改什么)+ 预期方向(提高/降低)+ 预期量级(MDE)

第二步:计算样本量(使用上方 Tab 1)

输入基准 CVR、MDE、置信水平和日均访客数,得出:

  • 每组所需样本量
  • 预计测试天数

在测试周期结束前,不要看数据,不要停止。

第三步:检验显著性(使用上方 Tab 2)

测试结束后,输入 A/B 两组的实际访客数和转化数:

  • p-value < 0.05 → 结果显著,可推广赢家
  • p-value ≥ 0.05 → 结果不显著,继续测试或重新设计假设

使用两比例 Z 检验(Two-Proportion Z-test)的样本量公式:

n = [ z(α/2) × √(2p̄(1-p̄)) + z(β) × √(p₁(1-p₁) + p₂(1-p₂)) ]²
─────────────────────────────────────────────────────────────
(p₂ - p₁)²
其中:
p₁ = 基准转化率(对照组)
p₂ = 目标转化率(实验组)
p̄ = (p₁ + p₂) / 2(合并比例)
z(α/2) = 置信水平对应的 z 值(95% 置信 → 1.96)
z(β) = 统计功效对应的 z 值(80% 功效 → 0.842)

使用卡方检验(χ² test,df=1)判断两组转化率差异是否显著:

χ² = Σ (观测值 - 期望值)² / 期望值
p-value < α → 拒绝零假设 → 结果统计显著
p-value ≥ α → 无法拒绝零假设 → 差异可能是随机噪音