專題 › A/B 結果判讀器
A/B 結果判讀器:怎麼算、多少才算好
兩版數據丟進來——是真的贏了,還是樣本太少的雜訊?
1・這個數字到底在講什麼
這個工具在做的事,說穿了就是幫你回答一句話:「B版真的比A版好,還是你只是運氣好抽到比較會買的那群人?」 電商圈很多人做A/B測試只看一個數字——轉換率誰高。B版轉換率6%,A版5%,就直接宣布B版贏,隔天全站換版。但轉換率高不代表「贏」,樣本夠不夠大、差距是不是雜訊,這兩件事沒人在看。尤其流量小的賣家,一天可能才幾十個訪客,兩版加起來測一週還不到千人,這種規模下看到的差距,很多時候根本是隨機波動,跟真正的偏好沒關係。 判讀器在做的事,就是把「差距」跟「樣本量」一起丟進統計公式,算出這個差距在統計上站得住、還是根本站不住。站得住,代表你可以放心把資源押上去;站不住,代表你現在看到的贏家,下次跑同樣的測試很可能就換人贏,因為那只是噪音在講話,不是消費者真的比較喜歡B版。 這也是為什麼很多賣家測試做了一堆,改版改了一堆,業績卻沒什麼起色——不是版本不好,是每次判斷的依據本身就不可靠,等於一直在追雜訊。
2・怎麼算:一步一步走一次
假設你這個月測兩個商品頁版本。A版(原版)曝光1000人次,成交50筆,轉換率5%。B版(新版)曝光1000人次,成交65筆,轉換率6.5%。 第一步,算相對提升:(6.5%-5%)÷5%=30%。看起來B版贏了三成,很誘人。 第二步,先不要急著下結論,算「合併轉換率」,也就是把兩版的成交數加起來除以曝光數加起來:(50+65)÷(1000+1000)=115÷2000=5.75%。這個數字是假設兩版其實沒有差異時,大家共同的平均水準。 第三步,算標準誤(衡量這個差距有多少是雜訊造成的合理波動範圍): √[5.75%×(1-5.75%)×(1/1000+1/1000)] =√[0.0575×0.9425×0.002] =√0.0001084 ≈1.04% 第四步,算z值,也就是「實際差距」除以「雜訊的合理波動」: (6.5%-5%)÷1.04%=1.5%÷1.04%≈1.44 第五步,比對門檻。一般抓95%信心水準,z值要超過1.96才算站得住。這裡算出來是1.44,沒過門檻。 結論:B版看起來贏了30%,但這個「30%」很可能只是雜訊,不是真的有效。要更有信心,得繼續跑,累積更多樣本,或者接受這次測試看不出差異。
3・多少才算好?怎麼判斷
多少才算好,沒有一個固定的萬能數字,但有兩個判斷角度你可以照著走。 第一個角度是統計顯著性,也就是上一節算的z值或p值。業界常用的門檻是95%信心水準,對應z值要超過1.96。但這個門檻不是鐵律,你如果用的是某個A/B測試工具或廣告平台內建的判讀,它可能設80%、90%或95%不等,這個去你用的工具後台查設定,不要照抄別人文章寫死的數字。 第二個角度是「有沒有跑滿足夠的樣本量」。很多人以為跑了兩週就叫跑完,其實重點不是時間長短,是有沒有累積到足夠的轉換數。轉換數太少(比如兩版加起來成交不到一百筆),就算z值算出來過門檻,也很容易是巧合。一般建議每個版本至少要有一定量級的轉換樣本(通常業界抓三位數以上比較穩),流量小的賣家沒辦法快速累積,就代表你需要拉長測試週期,而不是提早下判斷。 還有一個常被忽略的角度:統計顯著≠商業上值得做。假設B版真的顯著贏A版,但差距只是轉換率多0.3個百分點,換算下來一個月多賺的錢,還不夠付你改版跟測試耗掉的人力成本,這種「贏了統計、輸了生意」的情況也不少見。所以算完顯著性之後,記得拿這個提升幅度去跑一次ROAS損益兩平試算,看看這個提升到底值不值得繼續投入資源複製到全站。
4・最常見的三個誤區
第一個誤區,看到相對提升數字很漂亮就衝。像前面算過的例子,B版轉換率6.5%比A版5%高了三成,聽起來很誘人,很多人看到這種數字直接找主管簽核全站換版,但實際樣本只有各一千人次,統計上根本站不住。上線後轉換率打回原形,還得回頭解釋為什麼「明明測試贏了」結果沒用。 第二個誤區,測試還沒跑滿一個完整週期就喊停。常見情況是週三看數據B版領先,週四就把A版關掉宣布結案。但週末跟平日的消費者行為結構本來就不一樣,你看到的「領先」很可能只是抽樣時間點碰巧偏向某個版本,等於被星期效應騙了,不是真的偏好差異。 第三個誤區,一次改太多變數,卻只用單一總轉換率去判斷輸贏。比如同時把標題、主圖、價格都換掉,測完只看到「B組合總轉換率比較高」,卻不知道究竟是哪個改動在起作用。這對流量大的賣家還好,多測幾輪慢慢拆解;但流量小、一天不到五十訪客的賣家,兩週也才幾百人次,根本不夠拆給多變數測試用,跑出來的贏家組合下次想複製,往往複製不出同樣結果,因為當初的「贏」本來就是雜訊湊出來的。
5・算完之後該做什麼
算完顯著性,先分兩條路走。第一,顯著且提升幅度夠大:把贏的版本全站上線,但別馬上放著不管,上線後前一兩週還要繼續盯數據,因為新版剛上線常有「新鮮感效應」,數字會虛高一段時間再回歸真實水準,這時候才是它的真實表現。 第二,不顯著,或者顯著但提升幅度小到不划算:別硬要挑一個贏家出來交代,誠實接受「這次測試看不出差異」,把資源挪去測下一個假設,通常改動幅度更大的測試(比如整個賣點重新定位,而不是微調一顆按鈕顏色),更容易測出有意義的差距。 不管哪條路,測試結果都該回頭餵給其他判斷工具,形成一個循環,而不是測完就結案放著。提升幅度確定站得住之後,拿去跑一次ROAS損益兩平試算,確認這個轉換率提升在實際廣告成本下真的划算,不是為了測試而測試。如果打算測下一批受眾或下一個賣點角度,先用廣告受眾假設產生器把假設列清楚,避免下一輪測試又是憑感覺亂猜版本內容。而如果這次測試的是商品頁標題或賣點文案,贏了的那組寫法,也可以直接丟進蝦皮商品標題與賣點產生器裡,看能不能延伸出同樣邏輯的變體,繼續往下一輪測試推進,而不是每次都從零開始想文案。
現在就用你自己的數字算一次
讀完不算,等於沒讀。這個工具不用註冊、不用留 Email,算完的結果可以直接複製走。