先講一個違反直覺的事實。你以為 A/B 測試常給你答案,但業界大型審計顯示:多數測試最後是「無勝出者」,而看起來有勝出者的那批,一半根本重現不了。這意味著台灣廣告主每天在做的優化決策,很大機率是根據雜訊在調整。
工具本身沒問題。壞在跑法。樣本量沒算、看到數字就停、一次改三個變數,這三件事只要犯一件,結論就已經失效。以下六節依序拆解每一項,看它在台灣情境的實際樣貌。最後一節補上因果測量:多數團隊忽略掉的關鍵一層。

什麼是統計顯著性,為何 74.2% 測試找不到勝出者
統計顯著性衡量的是:你看到的組間差異,有多大機率不是隨機波動造成的。95% 顯著水準的意思,是若兩組其實一樣,觀察到目前這種差異的機率只有 5%。它不代表「B 比 A 好 95%」,這是最常被誤讀的一句話。
統計顯著性:在虛無假設為真(也就是兩組其實沒差異)的前提下,觀察到目前這麼極端或更極端數據的機率。這個機率就是 p-value,低於 0.05 稱為「達顯著」,也就是可以拒絕虛無假設。
Visionary Marketing 於 發布的 A/B Testing Statistics 2026 研究,彙整了 2023 到 2026 年跨產業 4,200+ 個 A/B 與多變量實驗,結果很不好看。
4,200 個測試中,74.2% 落在「無可偵測差異」或無定論;17.4% 有顯著勝出版本,另 8.4% 有顯著失敗版本。看起來達顯著的那批也不樂觀,41.4% 統計力不足 80%,只有 28.4% 在全量流量下能重現原效果。
翻成白話。你每跑 10 個 A/B 測試,有 7 到 8 個大概率沒答案。剩下有結論的那批,超過一半就算再跑一次也回不到當初那個「勝出」的方向。工具沒壞。問題出在多數團隊沒算樣本量、太早停、把雜訊當成訊號。
這批數字目前是英美市場最完整的實證。台灣沒有同等規模的公開審計。但業內操盤經驗顯示,台灣情況只會更糟不會更好,理由後面幾節會拆。
下一節先從樣本量講起,因為它是三個系統性錯誤裡最好修的一個。
樣本量計算的三個核心參數
樣本量不是憑感覺,也不是「跑到有錢的預算跑完為止」。它由三個參數決定:基準轉換率、最小可偵測效果、統計功效。三者定下來,樣本量就是算出來的一個數字。
先看三個參數在做什麼。
| 參數 | 業界標準 | 意義 |
|---|---|---|
| 基準轉換率(Baseline) | 用你當前實際數字 | 對照組目前的轉換水準,越低所需樣本越大 |
| 最小可偵測效果 MDE | 2%–10% 相對提升 | 你想能偵測到的最小改善,設越小需要越多樣本 |
| 統計功效 1-β | 0.8(80%) | 若真有差異,這個實驗有多少機率能抓到 |
| 顯著水準 α | 0.05(95% 信心) | 可以接受多高的假陽性率 |
把數字代進 Visionary Marketing 給的範例。基準轉換率 3%、想偵測 5% 相對提升、95% 信心水準加 80% 統計功效,每一組需要 14,800 個 session,A、B 兩組合起來就是 29,600 個。若你每天流量 1,000 個 session,這個測試要跑 30 天。
把 MDE 拉大到 20% 相對提升,樣本可以降到每組 15,000 個訪客;若把 MDE 縮到 5% 絕對提升,每組要 240,000 個訪客。這個關係是非線性的,MDE 縮一半、樣本大約要四倍。
台灣中小電商日流量落在 500 到 3,000 之間居多。若你每天轉換不到 100 次,硬要偵測 5% 以下的相對提升,實驗要跑三個月起跳。這時務實做法是把 MDE 放寬到 10-15%,或改用貝葉斯 A/B 測試框架降低樣本需求,前提是搭配良好的先驗設定。
字節跳動火山引擎、神策數據等企業級實驗平台已把這條公式內建。行銷人只需輸入歷史轉換率與目標 MDE,系統就自動吐出樣本數與建議天數。台灣行銷人若沒用類似平台,CXL、Statsig 都有免費計算器可以複刻同一功能。
樣本量算好了,接下來的挑戰是不要在中途偷看。
提前停測與偷看陷阱
提前停測是所有錯誤裡最普遍、代價最高的一個。看到「達 95% 顯著」就關掉實驗上線。這種做法從連續資料中挑選時間點,等於把假陽性率主動放大。
為什麼會這樣。A/B 測試的 p-value 在測試過程中會隨著資料進來上下跳動,這是隨機波動的正常樣子。若你每天都打開儀表板看,遲早會撞到一天 p-value 剛好掉到 0.05 以下。此時停測,其實只是在雜訊裡撿到了一個瞬間,這個瞬間剛好對自己有利。
顯著性不是停止測試的依據,樣本量才是。達到 95% 顯著性就立刻停止,忽略了「樣本量」才是真正的停止依據;太早停止本質上是在連續看數據中選擇了對自己有利的時間點。
Visionary Marketing 的 4,200 測試研究中,那 41.4% 宣稱顯著卻統計力不足的實驗,多數就是這個模式的犧牲品。它們達到某個瞬間顯著就停了,樣本量從沒到達計算出來的門檻。也難怪這批「勝出」實驗只有 28.4% 能在全量流量重現。
把「顯著性」當停止依據,等於容許實驗被最短、最不完整的一段資料決定。多數台灣廣告主跑 A/B 測試沒設樣本量門檻,看到「B 比 A 高 20%」就上線,這個 20% 有很大機率下週就消失。
正確做法:先算樣本量、鎖死日期
要修這個問題只有一條路。實驗啟動前,用計算器算出所需樣本量。以 3% 基準轉換率、5% MDE、95% 信心水準加 80% 統計功效為例,每組需 14,800 個 session;把這個數字除以每日流量得到最短天數,加上兩週保底涵蓋完整週期,訂一個固定結束日。這個日期到之前,即使某天看到亮眼數字也不動它。
若組織文化真的無法接受「等到底」,可以改用 Sequential Testing 或貝葉斯框架。這兩種方法在數學上允許中途查看而不放大假陽性,代價是需要額外的統計知識或平台工具。
樣本量的坑跳過了,接下來換一個更隱蔽的:一次測太多版本。
多變體膨脹:一次測太多版本會產出假贏家
同時測 3 個以上的變體,每加一個對照組就多一次「產出假陽性」的機會。這是統計學裡的多重比較問題,行銷團隊常低估它。
思路很簡單。單一 A/B 對比的假陽性率是 5%(因為 α = 0.05)。若你同時跑 A vs B、A vs C、A vs D 三對比較,只要其中一對達顯著就宣稱有勝出者,實際的假陽性率會累積上去,不再是 5%。
粗略的估算方式是 1 − (1 − 0.05)^k,k 是同時比較的組數。k=3 時假陽性率約 14%;k=5 時約 23%;k=8 時約 34%。也就是說,你同時測 8 個版本並挑最佳者宣布勝出,三次裡有一次那個「贏家」是統計噪音。
解決方法有兩條路。第一是 Bonferroni 校正。把顯著門檻從 0.05 除以比較次數,例如 4 個變體之間互相比就用 0.0125 當門檻。缺點是這個校正相對保守,會犧牲統計功效。第二是先做總體檢定確認整體有差異,再做兩兩比對。這個做法在嚴謹的實驗設計裡是標配。
台灣廣告主最常見的錯誤,是在 Meta 廣告後台一次上線 5 到 10 組素材,看哪組 ROAS 最高就宣布勝出。這種操作沒隔離變數,也沒做多重比較校正,只算「素材輪播」,跟統計意義上的 A/B 測試無關。
把樣本量、提前停測、多變體膨脹三個坑都閃過之後,問題還沒完。還有一層更深的挑戰。A/B 測試證明的是相關性,證明不了因果。這時就需要另一種工具。
A/B 測試不夠時,用 incrementality testing 補上因果
A/B 測試告訴你「哪個版本效果好」,incrementality testing(增量測試)告訴你「這個廣告有沒有帶來新的轉換,還是根本就會自然發生」。前者是相關性優化,後者是因果證明。
兩者差在哪。傳統 A/B 測試在已經看到廣告的受眾裡比較不同版本;增量測試則在「有看到廣告」與「完全沒看到廣告」的兩群人之間比。舉例來說:把 10-20% 的目標受眾隨機保留為 holdout group,測試結束比較兩群轉換率,差值就是廣告真正的增量貢獻。
這件事為什麼重要。多數平台歸因會把「本來就會買的人」算成廣告的功勞,因為那個人剛好在買之前看到過廣告。以 Meta 的 Conversion Lift 為例,它的做法就是隨機保留一群使用者不投該檔廣告,測試結束比較「有看到」與「完全沒看到」兩群人的轉換差異。這個差值才是廣告真的貢獻的增量。若不用 holdout 對照組,你永遠不知道廣告到底催生了多少「本來不會發生」的訂單。
依 IAB 2026 State of Data 研究,67% 到 76% 的買方決策者宣稱使用至少一種進階衡量方法(增量測試、歸因分析、行銷組合模型 MMM),但只有 39% 同時使用三種。多數組織有片段真相,不是完整的量測系統。
Holdout 實驗的最小可行版本
不需要昂貴平台也能跑增量測試。做法是把目標受眾隨機切成兩塊,一塊照常投放,另一塊在測試期完全不投(holdout group)。測試結束比較兩群的總轉換率,差值除以曝光組人數就是每人增量貢獻。
Meta 廣告後台內建 Conversion Lift Study,Google Ads 有 Brand Lift。台灣廣告主若預算允許,優先在品牌廣告、展示廣告這類「歸因常被高估」的通路做增量測試。這兩類通路傳統 A/B 常給假結論。增量測試通常會揭示一件事:真實貢獻,其實遠低於平台後台顯示的數字。
在利害關係人高度懷疑、有人要求證明的預算談判中,增量測試是唯一能產生那個證明的工具。
方法論講完了,接下來看看台灣廣告主實際掉在哪一層。
台灣 A/B 測試落差:從按鈕顏色到系統性方法論
台灣中小電商的 A/B 測試文化大致停在「跑三天看哪個按鈕顏色轉換好」這一層。統計顯著性、樣本量計算、增量測試這三個概念,在多數行銷團隊裡幾乎是陌生知識。
問題不在能力,工具與訓練都有落差。簡中市場神策、字節跳動火山引擎、GrowingIO 這些平台都內建了樣本量計算、多層互斥實驗分流、時間片輪轉等工程機制,把統計嚴謹性做進 SaaS 後台,行銷人不需要自己算公式。台灣市場對等的商用工具滲透率極低。多數團隊只有 Meta 或 Google 廣告後台的內建 A/B 功能,那個功能設計上不強調統計功效與樣本量門檻。
另一個落差在心態。前面提過廣告後台的 A/B 常被當成「素材輪播」,看數字挑最高就上線;業界通識的「先算樣本量、鎖死日期」在台灣廣告圈幾乎沒被談論。這種操作模式的長期代價,是決策全建立在假陽性上,一整年的優化累積下來,很可能沒有真實的複利貢獻。
2026 年 Meta 平台的另一層挑戰,是廣告組學習期(前 50 次轉換或 7 天)的干擾。台灣操盤手常在學習期內頻繁暫停、重開、改設定,導致學習期反覆重置,這種情況下所謂的 A/B 比較根本沒有可比基礎。
務實的三步升級路徑
台灣行銷團隊要補上這個落差不需要大改造。第一步是啟動任何測試前用計算器算樣本量,這件事零成本。第二步是把測試結束日期釘死在行事曆上,用制度綁住「不能偷看」。第三步是每季至少做一次增量測試,即使只是把 10% 受眾拉出來當 holdout,也能發現平台歸因高估了多少。
做完這三件事,你的 A/B 測試才真的算 A/B 測試,優化才有複利。
銷波快觀點:先修顯著性,再談優化
我們做過的實體案例裡,最經典的一個是按鈕顏色。直覺會告訴你紅色最搶眼、最能促發行動,但實測結果是綠色和黃色的轉換率更高。原因是紅色在潛意識裡連結到「停止」,綠色連結到「通行」。若沒有拿實測數字比對,這個判斷永遠會停在錯誤的直覺上。
另一件事是短期波動的陷阱。廣告數據有兩個常見誤導:小成本膨脹百分比、極值偏差製造虛假 ROAS。花 100 元賣出一張 4,380 元的課程,ROAS 43.8,但再花 9,900 元可能一張都沒有。看數據要看長期趨勢像看股票,今天 2%、明天 0.5% 會很痛苦,但長期往上就代表策略對了。
把這兩件事放在一起看。你會發現統計顯著性不只是統計問題,還是「你要不要相信短期數字」的價值觀問題。多數台灣廣告主的痛,出在把三天的漂亮數字當成勝出證據,然後把預算全押進去。等下週數字回落,才發現當初那個「贏」是雜訊,錢已經燒了。
DigitalApplied 的 2026 跨行業基準數據也給了一個佐證:A/B 測試勝率整體只有 25 到 36%,成功測試的中位數提升幅度是 +1.88% 轉換率、+2.77% 每訪客收益。也就是說即使做對了,多數勝出效果沒你以為的大。這反過來讓「先修顯著性,再談優化」更重要,因為錯誤決策的代價相對很高。
還有一件事我們自己踩過。做主題群集時我們曾用「搜尋量最高者為錨點」的自動規則,連續選錯三次。表面成因每次都不同(同名詞混淆、賞析詞混入產出詞、通路詞誤路由),但底層是同一件事:量大不等於代表性,就像顯著性不等於重要性一樣。統計上的「達顯著」若對業務決策沒差別,那個顯著就沒意義。
診斷框架也可以借用。當數據下滑時分兩類看:直接影響因素(廣告素材、文案、銷售頁),與間接影響因素(競爭對手、社群氛圍、環境變動)。統計顯著性能幫你確認「直接因素改動有沒有真效果」,但無法幫你判斷「這個效果是不是被間接因素干擾」。這時要靠增量測試把因果分離出來。
結論:先停止提前停測,優化才有複利
A/B 測試統計顯著性這件事,在台灣行銷圈的補課順序應該是這樣:先修「不要提前停測」這個習慣,再學樣本量計算,最後再加上增量測試這一層因果證明。三件事都做完,你才真的在做實驗;只做一件,你的優化其實是雜訊放大器。
今天可以做的第一步很小。下次啟動 A/B 測試前,打開 CXL 或 Statsig 的免費樣本量計算器,輸入你當前轉換率、目標 MDE、95% 信心水準加 80% 統計功效,看看實際需要跑幾天。若這個天數超出你的預算或耐心,把 MDE 放寬到 10-15%,重新計算一次。這個小動作,就能把你未來的決策從雜訊上拉起來。
喜歡這篇?讓行銷變好懂,訂閱銷波快。
資料來源
- Visionary Marketing UK — A/B Testing Statistics 2026: 4,200-Test Study
- LiftLab — What Is Incrementality Testing? A CMO Guide
- HubSpot Blog — How to determine your A/B testing sample size & time frame
- CXL — 10 Statistics Mistakes and Traps in A/B Testing
- 神策數據 — 試驗樣本預估指南
- 火山引擎(字節跳動)— 從玄學走向科學:A/B Test 在廣告營銷領域應用
- 字節跳動數據平台 — A/B 實驗背後的秘密:樣本量計算
- 知乎投放社群 — 產品投放時如何做 AB 測試:實戰踩坑記錄