1. 入力は「対象者数」と「成果を達成した人数」
ABテスト有意差チェッカーは、実施済みのテスト結果を確認するツールです。案の配信やランダムな振り分けは行いません。対象者を重複なくA・Bへ振り分けた結果を用意し、期間と成果の定義をそろえます。
訪問数には重複のない対象者数、CV数にはその中で成果を1回以上達成した人数を入力します。1人が3回送信したからといって3CVとするイベント件数ではありません。GA4等の集計を使う場合も、人数とイベント数を取り違えないようにします。
2. CVRが4.0%から5.5%になった例
A・Bの2パターン、信頼水準95%で、MarkeKitの計算処理を実行した結果です。実際の事業成績ではなく、説明用に用意した数値です。
| パターン | 訪問数 | CV数 | CVR |
|---|---|---|---|
| A(基準) | 1,000 | 40 | 4.00% |
| B | 1,000 | 55 | 5.50% |
- CVRの差:5.5 − 4.0 = +1.5ポイント。
- 相対的な改善率:(5.5 ÷ 4.0 − 1)× 100 = +37.5%。
- p値:約0.1148。95%の信頼水準では「有意差なし」。
「+1.5ポイント」と「+37.5%」は、同じ変化を別の基準で表した数値です。大きく見える改善率だけで判断せず、元のCVRと人数もセットで伝えます。
「有意差なし」は「効果が同じ」という証明ではありません。このデータと判定条件では、差があると判断するだけの根拠が十分ではない、という結果です。
p値は「Bが勝つ確率」ではない
p値は「本当のCVRに差がない」と仮定したとき、今回と同程度以上の差が現れる確率を表します。Bが正解である確率や、次も同じ改善が起きる確率ではありません。
3. 同じCVRでも、人数が違えば判定が変わる
次の2行は、CVRが同じになるよう用意した別々の計算例です。1つ目のテストを「有意差が出るまで延長する」手順を示したものではありません。
| A/Bの入力(訪問数・CV数) | CVR | p値 | 95%での判定 |
|---|---|---|---|
| A:1,000・40/B:1,000・55 | 4.0%/5.5% | 約0.1148 | 有意差なし |
| A:10,000・400/B:10,000・550 | 4.0%/5.5% | 約0.000000615 | Bが有意に高い |
差の大きさはどちらも+1.5ポイントですが、推定のばらつきが変わるため、判定は異なります。ただし「何人集めればよいか」は、期待する差や事前のCVR等を含めて設計する必要があり、この例の1万人を共通の必要人数にしないでください。
成果が少ない場合の例
Aが50人中2CV、Bが50人中5CVなら、CVRは4%と10%です。本ツールでは期待度数が小さいためFisher検定に切り替わり、p値は約0.4360、95%では有意差なしになります。見かけの改善率が+150%でも、人数と不確実性を無視できません。
4. 3〜4案では、Aを基準に比較する
C・Dを加えた場合、A対B・A対C・A対Dを計算し、複数比較による誤判定を抑えるためHolm法でp値を補正します。2案だけの結果と、3〜4案での結果が同じ判定になるとは限りません。
このツールはB・C・D同士を比較していないので、Aより高い案が複数あっても、その中の「最良案」を確定することはできません。また、各CVRのWilson信頼区間は個別の推定で、多重比較の補正はしていません。区間の重なりだけで有意差を判定しないでください。
5. 判定の後に、実務で確かめること
- ランダムな振り分け、集計期間、成果の定義がそろっていたか。
- 同じ人や複数回の成果を重複して数えていないか。
- 事前に決めた終了条件で判断しているか。
- 差が統計的に有意でも、制作費や運用負担に見合う改善か。
- 別の期間や対象者にも同じ結果が出ると、過度に一般化していないか。
このチェッカーは、期間や人数を決めたうえで評価する検定です。毎日確認して、有意差が出た時点だけを選んで終了すると誤判定が増えます。結果を見ながら終了条件を都合よく変更しない運用が必要です。
売上平均や客単価など、割合ではない指標の比較には使えません。「何を成果と数えるか」を先に決めてから、数値を入力してください。
計算方法の参考
NIST:2群の比率の比較、R:p値の多重比較補正。掲載した数値はMarkeKitの計算処理で確認した説明用の例です。
この記事のツールを使う
詳しい対応形式・上限・FAQは各ツールの操作画面の下にあります。