專題 › A/B 測試樣本數試算
A/B 測試樣本數試算:怎麼算、多少才算好
要跑多少流量、幾天,結果才可信。
1・這個數字到底在講什麼
這個數字回答一個很簡單但常被跳過的問題:你這次 A/B 測試,到底該跑幾天、放多少流量進去,測出來的差異才不是運氣。 很多人測試做法是這樣:兩個版本各跑個三五天,看哪個轉換率高,高的就上線。但如果流量本來就小,這種比較根本沒意義,差個 0.5 個百分點,可能只是某天剛好進來一批比較捨得花錢的客人,跟你的版面設計一點關係都沒有。樣本數試算工具做的事,就是先把「多少人、多少天」這個門檻算出來,讓你在開始測試之前就知道終點在哪,不是憑感覺喊卡。 背後邏輯不複雜:你現在的轉換率是多少(基準值),你希望測出多小的差異(最小可偵測差異),還有你能接受多少誤判的風險(信心水準跟檢定力)。這三個東西一起決定了樣本數。基準轉換率越低、你想偵測的差異越小,需要的樣本就越誇張,這也是為什麼很多小站測「按鈕顏色」測了一個月還測不出結果——差異太細,流量又不夠,根本測不出來。 這工具存在的意義,是讓你在花時間跑測試之前先算一次帳,值不值得測、要跑多久、需要多少流量,一次看清楚,而不是測到一半才發現樣本根本不夠,白白浪費兩週流量。
2・怎麼算:一步一步走一次
假設你現在的商品頁轉換率是 3%,你設計了一個新版頁面,預期可以拉到 3.6%,相對提升大概兩成。這個提升幅度就是你要偵測的最小差異。 先抓兩組的平均轉換率,(3% + 3.6%) ÷ 2 = 3.3%,換算成小數是 0.033。 用常見的樣本量估算公式:n ≈ 16 × p(1-p) ÷ (p1-p2)² p(1-p) = 0.033 × 0.967 ≈ 0.0319 p1-p2 = 0.036 - 0.03 = 0.006,平方後是 0.000036 n = 16 × 0.0319 ÷ 0.000036 ≈ 14,200 這個 14,200 是「每一組」需要的樣本數,A 版跟 B 版都要各跑到這個量,兩組加起來大概是 28,400 人次流量。 再回頭看你的流量現況。假設你的商品頁每天自然流量是 500 人,對半分配給 A、B 兩版,每版一天進 250 人。14,200 ÷ 250 ≈ 57 天。 算到這裡,答案就很清楚了:兩個月都跑不完一個「差異兩成」的測試。這時候你有兩個選項,一個是拉大流量,把預算挪一部分去導流;另一個是放寬你想偵測的差異,比如只測能不能看出 5 成以上的提升,樣本量需求會大幅下降。這個抓大放小的判斷,就是這個工具真正幫你省下的時間。
3・多少才算好?怎麼判斷
好不好,不是看轉換率漂不漂亮,是看「達到樣本量之後,差異還在不在」。很多人犯的錯是測試才跑到一半、樣本量連三分之一都不到,就看到 B 版數字領先,馬上下結論。這種提前判讀,九成會被後面的流量打回原形。 業界比較穩的做法,是先設定信心水準跟檢定力,常見抓法是九成五的信心水準、八成的檢定力,這代表你願意接受一定比例的誤判風險,但不會高到讓測試結果變成擲骸子。把這兩個數字丟進公式,才會算出前面那種一組要一萬多人的結果。如果你想要的把握更高,樣本量只會更誇張,不會變少。 判斷一個測試好不好,還要看「達到顯著之後,差異對你有沒有商業意義」。假設你真的跑滿 57 天,B 版轉換率顯著贏了 A 版 0.6 個百分點,但你算一下,這 0.6 個百分點換算成每月多出來的訂單,可能才多個十幾單,如果換版要花的成本比這個還高,這個「顯著」對你來說就沒有實際意義,顯著跟值得做是兩件事。 另外要留意的是,樣本數算出來是最低門檻,不是抓越多越好就一定越準。跑超過需要的樣本量太多,只是多花時間,測試結論不會因此變得更可信,反而增加了流量結構跑掉的風險,比如中途遇到促銷檔期,把整個測試環境弄髒了。
4・最常見的三個誤區
第一個誤區,是把「有感覺差異」當成「有統計意義的差異」。看到 A 版轉換率 3%、B 版 3.4%,覺得B版贏了,樣本才跑了三天、五百人,就急著結束測試換版。這種差距在小樣本底下,九成是雜訊,不是真訊號,換版之後很可能轉換率又掉回原點,老闆還以為是設計團隊亂改。 第二個誤區,是測試期間流量結構不對稱,卻沒察覺。比如平日流量導去 A 版,週末才切給 B 版,或者測試跑到一半剛好遇到蝦皮或平台大促,流量品質跟平常完全不一樣。這種情況算出來的顯著性數字看起來很漂亮,但兩組樣本根本不是在同一個世界裡跑,結論沒有參考價值,這也是最容易被忽略、卻最傷測試可信度的問題。 第三個誤區,是只看主指標達標就收工,沒看配套指標被犧牲。常見情況是新版結帳頁把「加購物車率」衝高了,測試看起來大獲全勝,但沒人回頭去查退貨率跟客訴量,結果加購率是靠強迫勾選或誤導文案衝出來的,退單一堆,實際毛利反而比原版更差。測試贏的是虛榮指標,輸的是真正該看的錢。
5・算完之後該做什麼
樣本數算出來、測試也跑完了,先確認達到門檻沒有,沒達到就別下結論,寧可延長天數或加流量,也不要提前開獎。 達到顯著之後,回頭看這個差異的商業意義值不值得換版,把預期多賺的訂單數換算成金額,跟換版的成本、風險放在一起比,這一步可以直接搭配 ROAS 損益兩平試算,看看新版上線後的廣告投放能不能撐得住,不要測試贏了、廣告卻開始賠錢。 如果贏的版本要拿去投廣告放大,下一步該想的是「這個結果適用在哪一群人身上」,測試樣本通常來自現有流量,不代表換一批新受眾也會有同樣表現,這時候可以用廣告受眾假設產生器,先把可能的受眾輪廓列出來,再決定要不要針對特定族群再測一輪,不要把一次測試的結論無限套用到所有廣告受眾上。 如果這次測的是文案或標題,贏的版本也不代表就是終點,可以拿蝦皮商品標題與賣點產生器再生成幾組變體,針對贏的方向再細測一次,把差異的顆粒度縮小,這樣才能真正把轉換率一階一階往上磋。測試不是做一次就結束,是每次都比前一次更準一點。
現在就用你自己的數字算一次
讀完不算,等於沒讀。這個工具不用註冊、不用留 Email,算完的結果可以直接複製走。