A/B 測試樣本量要先填四個數字才算得出來

A/B 測試樣本量由四個參數連動算出來:基準轉換率、最小可偵測效果、顯著性水準、統計功效。四個欄位空著任何一個,計算器就跑不出數字,憑感覺抓的流量門檻也就沒有依據。

先把名詞講清楚。轉換率指的是進到頁面的人裡面,實際完成目標動作的比例,完整說明放在 轉換率術語頁。基準轉換率就是你現在的表現,從 GA4 或自家後台撈得到。

第二個是最小可偵測效果,業界簡稱 MDE。它問的是一件很實際的事:多小的改善,你會願意為它改版?如果答案是「提升 0.3% 我也想抓到」,那樣本量會爆炸。

後面兩個是統計參數。Statsig 的樣本量說明裡寫得很直白:「Defaults of 0.05 alpha and 0.8 power are standard.」Optimizely 的說法一致,文件裡提到功效分析要考慮「significance level (usually 0.05), power level (often 0.8)」。中國的 BI 工具商億信華辰在 A/B 測試教學裡也是同一組數字,原文寫「α和β分别称为第一类错误概率和第二类错误概率,一般分别取0.05和0.2」。

三份互相獨立的文件,中英文各半,落在同一組預設值。這種重合比單一來源講十次更有說服力。

A/B 測試樣本量的四個必填參數與它們的連動方向
參數 它在問什麼 常見預設 對樣本量的影響
基準轉換率 現在的表現是多少 從自家數據取 越低,需要越多樣本
最小可偵測效果(MDE) 多小的差距你會在意 依業務決定 設越小,需要越多樣本
顯著性水準 α 容忍多少誤判有效 0.05 訂越嚴,需要越多樣本
統計功效 1-β 真有效時抓到的機率 0.80 要求越高,需要越多樣本

顯著性水準 α 管的是第一類錯誤,也就是明明沒差卻說有差。統計功效管的是第二類錯誤,明明有差卻說沒差。行銷圈熟悉前者,對後者幾乎沒有防備。

四個數字填完,樣本量才算得出來。下一節談 0.80 這個預設值,也就是四個裡面最常被忽略的那一個。

功效不足的測試會靜靜漏掉有效的版本

統計功效低於 0.80 的測試不會報錯,它會給你一份看起來很正常的報告,上面寫著兩版沒有顯著差異。真正有效的改版就在這份報告裡被判死,而且沒有任何跡象。

Statsig 在樣本量文件裡把這件事講得很不客氣。

Too few users increase Type II errors: real wins slip by. Missed lifts hurt engagement and revenue.

— Statsig,A/B Test Sample Size 產品文件

假陽性至少會露出馬腳。你上線了,數字沒有跟著動,過一陣子總會有人問。漏判不會。以電商結帳頁為例,實驗跑滿 14 天、結論寫成「維持原版」、資料歸檔,整個流程乾乾淨淨。

這裡有個容易誤會的地方:功效不足並不等於結果不準。它的意思是,這場實驗從設計階段開始,就沒有能力看見你想找的那個效果。用一把最小刻度 1 公分的尺,量不出 0.5 公釐的差距,量幾次都一樣。

業界預設的統計功效 0.80 代表:就算版本 B 真的比較好,你也有 20% 的機率什麼都看不到。這是在標準設定下就已經接受的漏判率,功效再往下掉,漏判率只會更高。

那要怎麼避免?答案回到上一節:開跑之前先算樣本量,並且誠實面對算出來的數字。具體來說,計算器如果說要 90 天的流量,這場實驗現在就跑不了,把它縮成兩週再跑只是換一種形式的漏判。

中國技術文件把樣本量公式攤在開跑之前

中國幾份公開的技術文件這樣處理 A/B 測試樣本量:統計公式直接寫進實驗設計章節,不放附錄。百度雲的開發者文件裡就有完整算式。

百度雲那篇談 A/B 實驗統計學的文件,正文裡直接給出最小樣本量公式,形式是 n = σ² / Δ² × (zα/2 + zβ)²。σ 是標準差,Δ 是預期效果量。同一篇也講了參數之間的取捨關係,原文寫「顯著性水平越低,對實驗的要求越高,所需樣本量越大」。

公式本身沒有什麼玄機,教科書上就有。真正關鍵的是它出現的位置。這類文件把公式放進實驗流程的第 2 步,位置在假設設定之後、開跑之前,順序寫死。

億信華辰的教學也是同一種編排:假設設計、樣本量計算、隨機分流、顯著性檢驗,四階段依序走完。文件裡明講 α 與 β「一般分别取0.05和0.2」,把預設值當成流程的起點而不是討論題。

公式裡 Δ 在分母而且平方。這代表你想偵測的差距每縮小一半,需要的樣本量會變成四倍。MDE 從 2% 調到 1%,代價不是多一倍流量。

這一點在實務上很殘忍。多數中小型電商的月流量,撐不起一個小 MDE 的實驗,而這件事在開跑前用計算器就能知道。常見的狀況是實驗跑完、數字不顯著、再回頭猜是不是流量不夠。順序反了。

順帶一提,網路上流傳一組「偵測 1% 提升需要每組 189 萬次訪問」的算例。我們循原始連結查證時,那個頁面回傳 403,無法確認出處,因此這篇不引用這個數字。方向性的結論仍然成立:小 MDE 需要的流量,遠比多數人直覺以為的多。

流量不夠時調整 A/B 測試樣本量需求的三個做法

算出來的 A/B 測試樣本量超過現有流量時,可行的調整有三個方向:把 MDE 放大、把測試期拉長、把版本數砍少。三個都是公開文件裡寫過的做法,共通點是不動統計標準。

Statsig 的文件對前兩個講得很乾脆:「If timelines choke, either raise the MDE or extend the run; both are valid.」時間排不下,就把 MDE 提高或把實驗跑久一點,兩個都合法。同一份文件也提到第三個選項,建議「cut variants so each arm gets more traffic」,減少版本數讓每一組分到更多流量。

把 MDE 放大的意思,是改測比較大的變動。與其比較兩個按鈕文案的細微差別,不如整個版面重做一版。訊噪比拉高,需要的樣本量就下來了。

拉長測試期有下限也有上限。Convertize 的統計指南寫著「Run sequential tests and don’t test for less than a week」,理由很生活化:星期天的銷售不會跟星期一長得一樣。AdMetrics 的實驗基準文件則提到,電商的最短執行期常落在 2 到 4 週,用來蓋過一個完整的消費週期。

執行期的合理區間大致是 最少一週2 至 4 週。低於一週會被星期效應污染,長到幾個月則要小心期間的活動、季節與流量結構都變了,前後兩段其實不是同一群人。

三個做法之外,還有一件事不能做,就是提前收單。Convertize 把它獨立成一個章節,規則寫得很短:「Don’t respond to your results before they are significant.」每天打開後台看一次顯著性,看到好看的數字就停,這個動作本身會製造假陽性。

AdMetrics 的建議是把停止規則寫在前面,開跑之前就講好什麼條件下收單,並且依獲利而不是偏好來決定 MDE 與執行期。規則先寫,數字後看,順序不能顛倒。

銷波快觀點:樣本量算不出來的實驗,本來就不該開跑

我們自己的基準筆記裡有一組數字很值得放在這裡看:A/B 測試的勝率大約落在 25% 到 36%,而成功測試的轉換率提升中位數只有 +1.88%。這兩個數字擺在一起,等於說多數實驗本來就不會贏,而會贏的那些,效果量比很多人設定的 MDE 還要小。把 MDE 設在 1% 以下再抱怨測不出來,某種程度上是自己給自己出難題。

流量真的不夠的時候,我們常用的是 3×3 測試法:固定素材、文案、CTA 三個元素,只變動受眾族群,分成三組投放,每組每天大約 15 美金。它不追求統計顯著,追求的是控制變因下的方向判斷。如果三個族群的點擊率都低於基準線,問題出在素材、文案或 CTA;三個元素都確認沒問題還是跑不動,那多半是產品本身的事。這種做法要講清楚定位,它是探索工具,不是拿來宣稱誰贏的證據。

建關鍵字主題群時,我們踩過一個很像的坑:曾經用「取搜尋量最高的詞當錨點」這條自動規則,連續選錯 3 次。其中一次選到的詞量很高,但那是同名詞,量是假的。教訓寫成一條紅線:量高只代表這個詞熱,不代表它能代表這個群。A/B 測試的樣本量是同一件事的另一面。具體來說,流量數字很大不等於這場實驗有代表性,分流方式、時段分佈、裝置組成任何一項歪掉,樣本再多也救不回來。

另一個更貼近的教訓:我們有兩篇文章的目標關鍵字是猜的,後來查 GSC 才發現猜的詞 0 曝光,真正在排名的詞完全沒寫進文章。兩篇都得重做。當時的檢討是,這條規則要放在流程最前面才有用,寫完之後補救的成本高太多了。舉例來說,樣本量計算的位置也一樣,它放在開跑之前是設計,放在收尾之後只是解釋。

最後補一個測量口徑的提醒。做電子報 A/B 測試時,開信率會被 Apple 的郵件隱私保護干擾,點擊率才是比較可靠的行為訊號。樣本量算得再準,指標選錯一樣白做。

結論:先把四個數字填進計算器,再決定要不要開跑

這篇從頭到尾只講一件事:A/B 測試樣本量是實驗設計的起點。基準轉換率、MDE、α、統計功效,四個欄位填完,計算器會告訴你需要多少流量、大概要跑幾天。

算出來的數字如果超過你能給的流量,選項有 3 個,把 MDE 放大、把週期拉長、把版本砍少。三個都比把 α 從 0.05 放寬誠實。不做調整就硬跑,換來的是一份看起來很正常、實際上什麼都看不見的報告。

你現在手上如果正好有一個在跑的 A/B 測試,可以先問一個問題:開跑之前,有人算過樣本量嗎?如果沒有,那份結果目前還不能當成決策依據,先補上 4 個參數再看一次。

喜歡這篇?讓行銷變好懂,訂閱銷波快。

資料來源

  • A/B 測試
  • 樣本量
  • 統計功效
  • 最小可偵測效果
  • 轉換率優化
  • 實驗設計
吳宗翰 Jayden Wu

吳宗翰 Jayden Wu

ClassOn 雙捷數位有限公司 共同創辦人 | 銷波快 Podcast 主持人

2008 年從線下行銷做起,活動、連鎖加盟那一類。2014 年轉數位,做亞馬遜和 eBay,後來自己出來做聯盟行銷與 dropshipping。現在在臺北城市科技大學、TeSA 與經濟部的培訓計畫教課。做過的事讓他篩情報時說得出為什麼。

關於 Jayden →