MARKEKIT GUIDE

ABテスト結果の読み方:CVR差と有意差を分けて考える

BのCVRが高くても、その結果だけでBを採用できるとは限りません。差の大きさと統計的な判定、テストの条件を合わせて確認します。

MarkeKit運営 · 公開日:

1. 入力は「対象者数」と「成果を達成した人数」

ABテスト有意差チェッカーは、実施済みのテスト結果を確認するツールです。案の配信やランダムな振り分けは行いません。対象者を重複なくA・Bへ振り分けた結果を用意し、期間と成果の定義をそろえます。

訪問数には重複のない対象者数、CV数にはその中で成果を1回以上達成した人数を入力します。1人が3回送信したからといって3CVとするイベント件数ではありません。GA4等の集計を使う場合も、人数とイベント数を取り違えないようにします。

2. CVRが4.0%から5.5%になった例

A・Bの2パターン、信頼水準95%で、MarkeKitの計算処理を実行した結果です。実際の事業成績ではなく、説明用に用意した数値です。

パターン訪問数CV数CVR
A(基準)1,000404.00%
B1,000555.50%
  • CVRの差:5.5 − 4.0 = +1.5ポイント。
  • 相対的な改善率:(5.5 ÷ 4.0 − 1)× 100 = +37.5%。
  • p値:約0.1148。95%の信頼水準では「有意差なし」。

「+1.5ポイント」と「+37.5%」は、同じ変化を別の基準で表した数値です。大きく見える改善率だけで判断せず、元のCVRと人数もセットで伝えます。

「有意差なし」は「効果が同じ」という証明ではありません。このデータと判定条件では、差があると判断するだけの根拠が十分ではない、という結果です。

p値は「Bが勝つ確率」ではない

p値は「本当のCVRに差がない」と仮定したとき、今回と同程度以上の差が現れる確率を表します。Bが正解である確率や、次も同じ改善が起きる確率ではありません。

3. 同じCVRでも、人数が違えば判定が変わる

次の2行は、CVRが同じになるよう用意した別々の計算例です。1つ目のテストを「有意差が出るまで延長する」手順を示したものではありません。

A/Bの入力(訪問数・CV数)CVRp値95%での判定
A:1,000・40/B:1,000・554.0%/5.5%約0.1148有意差なし
A:10,000・400/B:10,000・5504.0%/5.5%約0.000000615Bが有意に高い

差の大きさはどちらも+1.5ポイントですが、推定のばらつきが変わるため、判定は異なります。ただし「何人集めればよいか」は、期待する差や事前のCVR等を含めて設計する必要があり、この例の1万人を共通の必要人数にしないでください。

成果が少ない場合の例

Aが50人中2CV、Bが50人中5CVなら、CVRは4%と10%です。本ツールでは期待度数が小さいためFisher検定に切り替わり、p値は約0.4360、95%では有意差なしになります。見かけの改善率が+150%でも、人数と不確実性を無視できません。

4. 3〜4案では、Aを基準に比較する

C・Dを加えた場合、A対B・A対C・A対Dを計算し、複数比較による誤判定を抑えるためHolm法でp値を補正します。2案だけの結果と、3〜4案での結果が同じ判定になるとは限りません。

このツールはB・C・D同士を比較していないので、Aより高い案が複数あっても、その中の「最良案」を確定することはできません。また、各CVRのWilson信頼区間は個別の推定で、多重比較の補正はしていません。区間の重なりだけで有意差を判定しないでください。

5. 判定の後に、実務で確かめること

  1. ランダムな振り分け、集計期間、成果の定義がそろっていたか。
  2. 同じ人や複数回の成果を重複して数えていないか。
  3. 事前に決めた終了条件で判断しているか。
  4. 差が統計的に有意でも、制作費や運用負担に見合う改善か。
  5. 別の期間や対象者にも同じ結果が出ると、過度に一般化していないか。

このチェッカーは、期間や人数を決めたうえで評価する検定です。毎日確認して、有意差が出た時点だけを選んで終了すると誤判定が増えます。結果を見ながら終了条件を都合よく変更しない運用が必要です。

売上平均や客単価など、割合ではない指標の比較には使えません。「何を成果と数えるか」を先に決めてから、数値を入力してください。

計算方法の参考

NIST:2群の比率の比較、R:p値の多重比較補正。掲載した数値はMarkeKitの計算処理で確認した説明用の例です。

この記事のツールを使う

詳しい対応形式・上限・FAQは各ツールの操作画面の下にあります。