A/B 測試與增量測試回答不同的問題
A/B 測試比較兩個版本,增量測試比較「有投」跟「完全沒投」。前者假設這個渠道值得花錢,後者拿這個假設本身來檢查。廣告實驗設計的第一步是決定現在要問哪一個問題。
增量測試工具商 Measured 把兩者的分界講得很乾淨。A/B 測試回答的是哪一個版本表現比較好,增量測試回答的是沒有這筆媒體投放,這件事還會不會發生。
A/B testing compares variations against each other to find which performs better. Incrementality testing compares outcomes with media against outcomes without media to prove causal impact.
incrementality testing(增量測試)指的是刻意留一群人完全不投廣告,或改投公益廣告,再拿兩群人的轉換差值當作廣告的真實貢獻。詳細定義收在 增量測試術語頁。
差別在實務上很現實。再行銷廣告的後台數字通常最漂亮,因為受眾本來就逛過商品頁、加過購物車。廣告在裡面扮演的角色,有時候只是提醒,有時候連提醒都算不上。Measured 一份零售商案例的讀數是,平台回報的轉換裡只有約 40% 屬於增量。另一個電商案例在導入增量測量之後,把每次增量獲客的成本降低了 30%。
| 比較項目 | A/B 測試 | 增量測試 |
|---|---|---|
| 回答的問題 | 哪個版本表現比較好 | 沒有這筆投放還會不會發生 |
| 對照組 | 另一個廣告版本 | 完全不投放的保留組 |
| 適合的時機 | 渠道已確認有效 | 渠道有效性尚未確認 |
| 影響的決策 | 素材與文案怎麼改 | 預算要不要繼續放 |
順序搞反的成本很具體。在一個沒有增量的渠道裡把素材優化到極致,只會讓報表更好看,帳上的營收不會多一塊。
演算法會污染你的對照組
手動開兩組廣告互相比較,在 2026 年的 Meta 環境裡已經不成立。演算法在測試期間就會偏心,把流量推向自己看好的那一組,兩組的曝光條件從第 1 天起就不對等。
傳統 A/B 測試的前提是隨機分組。廣告平台剛好相反,系統會把預算推向轉換率較高的位置。Five Nine Strategy 的創意測試框架把這件事列為第一個陷阱。測試還沒結束,流量分配已經先替你下了結論。
字節跳動數據平台講過同一件事。演算法廣告平台上,實驗失效最常見的原因是流量分配不均。Advantage+ 這類自動化功能會主動介入受眾與版位。手動切出來的兩組廣告,控制的變因比操作者以為的少很多。
可以怎麼做:用 Ads Manager 內建的 A/B Test 功能,讓平台在實驗層級強制均分流量。不要靠自己開兩組廣告再比報表。內建工具在系統層分流,手動比較做不到。
另一個被低估的干擾是學習期。測試中途調整預算或出價會重置學習階段,兩組廣告於是落在不同的學習狀態,數字差異裡混進了跟素材無關的東西。巨量引擎的 A/B 實驗手冊寫得更死:實驗期間不動出價、不動預算。
還有一種常見的污染來自變因太多。舉例來說,同時換掉素材、文案與受眾這 3 個變數,最後贏了也說不出贏在哪裡。單因素控制聽起來像基本功,實際上是最常被跳過的一步。
Meta 的增量測試怎麼設定才有效
Meta 廣告管理員內建轉換提升研究,邏輯就是保留組。系統把一部分受眾排除在投放之外,實驗結束後比較兩群人的轉換差距,差值即為這筆預算的真實貢獻。
設定上有 3 個位置容易踩空。第 1 是選對測試對象,再行銷與品牌廣告最值得優先測,因為兩者的帳面數字最容易被高估。第 2 是保留組的比例,切太小看不出差異,切太大等於自己放棄營收。第 3 是測試期間不要碰任何設定。
時間長度有明確建議。廣告分析工具商 Blip 的說法是,多數增量測試至少要跑滿 2 週,4 週更好。理由跟統計無關,跟消費行為有關:短於一個完整的購買週期,測到的只是這幾天剛好想買的人。
Blip 同時提到一個穩定出現的現象。用增量方法量到的 ROAS,通常低於平台回報的數字,落差往往不小。這件事本身沒有問題,兩個數字量的東西不同。問題出在拿平台回報的數字去做預算分配,卻以為自己看的是因果。
實務上比較安全的用法是把兩個讀數分工。平台 ROAS 用來看趨勢與方向,增量 ROAS 用來決定錢往哪裡放。
跑多久、要幾筆轉換才算數
實驗停不停得下來,由樣本量決定,跟看報表的次數無關。跑 3 天就宣布贏家,多數時候看到的是雜訊,不是效果。
統計上的 4 件套很固定:虛無假設、顯著性水準、統計功效、最小樣本量。慣例上顯著性水準設在 0.05,統計功效設在 0.80,最小樣本量由預期效果量與標準差推出來。把顯著性水準從 0.05 收緊到 0.01,所需樣本量會增加一大截。
換算成天數的公式也很直白:每組所需樣本量乘以組數,除以每天的流量。流量累積到最小樣本量之前,中途看數字沒有意義。
AdMetrics 的 2026 年基準文件建議,電商實驗至少涵蓋 一個完整的商業週期,多數品類落在 2 到 4 週。跨過週末很重要,週間與週末的購買行為差距,本身就足以左右結論。
還有一個收尾動作經常被省略:實驗結束後檢查兩組的樣本比例。具體來說,設定切 50/50 卻跑出 55/45,代表分流本身出了問題,這時候結論不管多顯著都不能用。序貫檢驗是另一個實用選項,允許中途觀察而不會膨脹誤判率。
停止規則要在開跑之前就寫下來,包含天數與轉換數兩個門檻。跑到一半才決定什麼叫贏,等於讓自己挑一個喜歡的時間點收工。
小預算怎麼安排實驗順序
預算不足的帳戶做不了保留組實驗,因為切走 10% 受眾之後,剩下的樣本量撐不起結論。可行的替代路線是把變因收得更窄,一次只驗證 1 件事。
順序可以這樣排。第 1 步用固定素材測不同受眾,確認產品與受眾的組合跑不跑得動,控制變因落在受眾這一層。第 2 步才進素材測試,這時候受眾固定,變動的只有素材。第 3 步再動落地頁與出價策略。
素材賽馬是另一種常見做法,同一組廣告丟進 5 到 10 個素材,讓演算法自己淘汰。這套機制本質上是多臂賭博演算法(Multi-armed Bandit),找贏家的速度比固定分流的 A/B 測試快,代價是統計嚴謹性。拿它做快速迭代很合適,拿它的結果當嚴謹結論就不合適。
兩件事的用途要分開。快速找到能用的素材是一回事,證明某個做法確實比較好是另一回事。以每月廣告費 3 萬元的帳戶為例,切 10% 受眾當保留組只剩下極少的轉換樣本,結論撐不起來,這種規模先把素材測順比較實際。
銷波快觀點:先證明值得投,再優化怎麼投
這套順序我們在自家的關鍵字決策上驗證過。當時的原始計畫把某個在地字組列為預算優先,實際掃過自然排名,發現前兩名本來就是自己的位置,買廣告等於左手打右手。真正該押的是另一組字,月搜尋量 3,600、自然排名掃到 80 名還沒收錄,那裡廣告是唯一入口。廣告預算的第一個問題從來就不是素材,而是這個位置沒有廣告會怎樣。
控制變因的成本比想像中低。3×3 測試法固定同一組素材、文案與行動呼籲,分別投三個受眾,每組每天約 15 美金就能看出點擊率跟 ROAS 跑不跑得動。三組都低於基準線,問題在素材或文案;三個元素都確認沒問題還是跑不動,那是產品的問題。重點在於族群是唯一的變數,歸因才做得出來。
另一個變化會改寫實驗設計的重心。廣告成敗現在有六成落在素材的數量與多元性,投放技術只剩三成,受眾與版位大多交給 AI 媒合。文案、素材、行動呼籲三個元素都調好,點擊率可以從 1% 到 2% 拉到 3% 到 4%,等於廣告費打了對折。要測的東西變多了,能手動控制的旋鈕反而變少。
數字看起來乾淨不代表它是乾淨的。我們查過兩個關鍵字的月曲線,發現連續 10 個月的量體逐字相同,兩個不同的詞不可能出現這種巧合,那是同一個聚類被套上兩個名字。廣告實驗也有同構的問題:後台給的數字通常正確,正確的數字被放在錯的問題底下,就會推出錯的決定。
最後一件事,關於什麼時候該相信自己的結論。我們曾經用同一條自動規則連續選錯 3 次錨點,每一次的表面原因都不同,到第 3 次才確認問題出在規則本身。實驗也一樣,單次結果只能當線索,同一個方向重複出現才值得寫進操作手冊。
結論:先確認渠道值得投,再去比素材
廣告實驗設計的難處不在工具,Meta 該有的功能都有。難處在決定現在要問哪個層級的問題。渠道有效性還沒確認,素材測試就沒有意義。優化的對象,可能是一件本來就不該做的事。
今天能動的 3 件事。第 1 件,把最大的一組再行銷廣告拉出來,看受眾是不是本來就會回來的人。第 2 件,下一次比較素材改用 Ads Manager 內建的 A/B Test,不要手動開兩組。第 3 件,把停止規則寫在開跑之前,天數與轉換數都要寫。
已經在做測試的人,可以先回頭檢查一件事。過去半年宣告過的贏家,有幾個是在滿足樣本量之後才下的判斷。
喜歡這篇?讓行銷變好懂,訂閱銷波快。
資料來源
- What’s the Difference Between A/B Testing and Incrementality Testing?measured.com
- 2026 廣告增量測試指南:Holdout Group 方法withblip.com
- A/B-Testing Benchmarks 2026: Decision-Grade Experimentation for DTC Growth Teamsadmetrics.io
- Incrementality Measurement Guide 2026: Holdout Tests and the Causal Truth Layersegmentstream.com
- Creative Testing for Algorithmic Campaignsfiveninestrategy.com
- 字節跳動 DataTester:廣告投放場景下的 A/B 實驗實踐cnblogs.com
- 巨量引擎 AB 實驗工具產品手冊zhuanlan.zhihu.com
- AB 實驗統計學精髓:假設檢驗與樣本量確定cloud.baidu.com