服務

A/B 測試怎麼做才不是自欺欺人?從樣本數、SRM 檢查到 GA4/PostHog/GrowthBook 選型的完整規劃

2026.08.24 · 7 次瀏覽
A/B 測試怎麼做才不是自欺欺人?從樣本數、SRM 檢查到 GA4/PostHog/GrowthBook 選型的完整規劃

日流量 800、轉換率 2.4% 的網站,要偵測 20% 提升需要 44 天——先算清楚,再決定要不要做實驗

分享:

那個「提升 41%」的實驗,其實什麼都沒證明

客戶傳來截圖:新版 CTA 轉換率 3.1%、舊版 2.2%,「可以全量上線了吧?」我們問三題:跑幾天(4 天)、兩組樣本各多少(1,180 / 1,460)、中途看過幾次(每天早上)。三個答案各對應一個致命問題:樣本不足、分流比例失衡(SRM)、重複偷看造成偽陽性。代價在後面:團隊據此改了全站按鈕,三個月後營收沒動,沒人知道原因。

適用情境 × 不適用情境

適合做 A/B 測試不適合做 A/B 測試
月轉換事件 ≥ 1,000 次月轉換事件 < 200 次,實驗要跑半年以上
有單一北極星指標與事前假設只想「看看哪個好看」
實驗期內頁面與環境穩定正在改版、換金流、跑大檔促銷
有工程資源做伺服器端/SDK 分流只能貼第三方 JS,又在意 Core Web Vitals
B2C、電商、SaaS 註冊漏斗B2B 高單價、月成交 5 筆

低流量網站正確做法是CRO 稽核 + 質性研究:5–8 位可用性測試、Microsoft Clarity 錄影與熱區、結帳逐步流失分析。小樣本下這些方法解釋力更高。

替代方案矩陣

方案分流統計起始成本(NT$)主要風險
GA4 + BigQuery 自算自寫 flagPython/R 自算工具 0;查詢 500–3,000/月需自建統計流程
PostHogSDK(前/後端)頻率論 + 序列檢定免費額度後 3,000–15,000/月(定價事件量大時費用跳升
GrowthBookflag,可純伺服器端貝式 + 序列檢定(文件自架 0,主機 1,500–4,000/月需自顧 SDK 與倉儲
StatsigSDK + 伺服器端序列檢定、CUPED免費額度大,超量按事件計進階功能綁企業方案
VWO / Optimizely視覺化編輯器內建年約 150,000 起;Optimizely 七位數用戶端注入,CLS 風險最高
Google Optimize2023 年 9 月停服公告

完整流程拆解(5 階段 / 6–10 週)

  • 階段 1:CRO 稽核與假設庫(1–2 週) 交付:漏斗逐步流失表、錄影摘要、20–30 條 ICE 排序假設。工具:GA4 探索、Microsoft Clarity、Figma、Notion。
  • 階段 2:實驗設計與樣本數計算(3–5 天) 交付:實驗規格書(1 主指標 + 3 護欄指標 + MDE + 預計天數 + 停止規則)。工具:Evan Miller、GrowthBook 計算機。
  • 階段 3:技術導入(1–2 週) 交付:feature flag 接上、伺服器端分流(Next.js/Laravel middleware)、分流 ID 寫入 first-party cookie、SRM 監控儀表板。
  • 階段 4:執行與監控(3–7 週) 交付:每日 SRM 檢查、每週護欄指標(錯誤率、LCP、客服工單)回報;主指標封存不看。
  • 階段 5:判讀與決策(3–5 天) 交付:效果量 + 信賴區間 + 分群拆解報告、上線/回滾決議。

真實成本完整拆解

項目金額(NT$)說明
CRO 稽核 + 假設庫35,000 起約 25–35 工時
CRO 實驗導入包80,000 起flag 架構、伺服器端分流、SRM 監控、首個實驗
CRO 月費顧問25,000/月起每月 1–2 個實驗的設計與判讀
工具訂閱0–15,000/月自架可為 0

隱藏費用:

  • 倉儲查詢費:BigQuery 超過免費 1 TB 掃描後計費,大站每月 500–3,000 元常見。
  • 技術債:實驗結束不清 flag,半年成維護負擔(約 4–8 小時/季)。
  • 效能代價:用戶端 anti-flicker snippet 擋渲染,推高 LCP 與 CLS(良好門檻 0.1),返工常比導入更貴。
  • 機會成本:跑 7 週的實驗等於該頁面凍結 7 週。
  • 判讀人力:每個實驗至少 6–10 工時。

實施真相 vs 客戶想像

客戶以為實際發生
兩週就能看到結果日流量 800、基準 2.4%、偵測 20% 相對提升(至 2.88%)每組需約 17,500 人、合計 35,000 人次,即 約 44 天(建議湊 7 整週)。只跑 14 天,只能偵測 35% 以上的提升
多開版本比較快4 個版本共用流量,44 天變 約 88 天,多重比較讓偽陽性率由 5% 升到 14%
每天看數字才能掌握進度固定期程下每日偷看,實際型一錯誤率會被推到 20–30%
贏了就代表營收會漲註冊率贏、退款率同步上升很常見,沒護欄指標就看不到
工具裝好就有洞見假設品質決定一切;沒有假設庫的團隊第三個月就沒題目

六個常見陷阱 × 解法

  • SRM(分流比例失衡):說好 50/50 卻跑成 48/52,代表分流或追蹤有 bug,結果全作廢。解法:每日跑卡方檢定,p < 0.001 立即停下除錯(SRM checker)。
  • peeking/看到贏就喊停解法:事前寫死停止日期;需中途決策就改用序列檢定(GrowthBook、Statsig 內建 always-valid p-value)。
  • 多重比較:同看 5 個指標,至少一個「顯著」的機率是 22.6%。解法:只設 1 個主指標,其餘為護欄,套 Benjamini-Hochberg 校正。
  • 前端閃爍(FOUC)與版位位移:用戶端 JS 換內容會先閃舊版。解法:改伺服器端或 edge middleware 分流。
  • 跨裝置身分不一致:同一人手機看 A、電腦看 B。解法:登入後以 user_id 分流,未登入用 cookie ID,固定 hashing seed。
  • 新奇效應與週期性:新設計前三天總是好看。解法:一律湊滿整週,最少 14 天。

成功指標 + 90 天路線圖

  • 第 30 天:flag 與伺服器端分流上線、SRM 每日綠燈、假設庫 ≥ 20 條、首個實驗跑滿天數。指標:LCP/CLS 無退化。
  • 第 60 天:完成 2–3 個實驗判讀(含失敗案例)、建立新舊客與裝置分群拆解。指標:實驗完成率 ≥ 80%、每個實驗都有書面結論。
  • 第 90 天:至少 1 個勝出變體全量上線並回測。指標:主漏斗相對提升 5–15%、每月穩定 2 個實驗、flag 債務為 0。

決策清單(12 題,全部「是」再開始)

  • ☐ 月轉換事件 ≥ 1,000 次?
  • ☐ 能說出唯一一個主指標?
  • ☐ 已算出 MDE 與天數且能接受?
  • ☐ 願意實驗期間凍結該頁面?
  • ☐ 有 3 個護欄指標(錯誤率、效能、退款)?
  • ☐ 能做伺服器端/SDK 分流,而非純 JS 注入?
  • ☐ 有每日 SRM 檢查?
  • ☐ 已事前寫下停止規則?
  • ☐ 接受「沒效果也是結論」,不事後改指標?
  • ☐ 有假設庫能產出下一題?
  • ☐ 知道誰負責清 flag?
  • ☐ 若要跑 3 個月以上,願意改做質性稽核?

常見問題 FAQ

日流量只有 200,還能做 A/B 測試嗎?

以 2.4% 基準計算,偵測 20% 提升要約 175 天,環境早就變了。把預算移到 CRO 稽核、可用性測試與漏斗修補。

Google Optimize 停掉後的免費替代方案?

GA4 的 BigQuery 匯出(免費)搭配自架 GrowthBook 成本最低,但需工程與統計能力;沒有工程資源就用 PostHog 或 Statsig 免費額度。

一定要用伺服器端分流嗎?

在意 SEO 與 Core Web Vitals 的話,答案接近「是」。用戶端分流需要 anti-flicker 遮罩,直接惡化 LCP 與版面位移。

實驗不顯著,是不是白做?

不是。「這個改動沒有 20% 以上效果」就是可行動的結論。真正白做的是沒假設、沒停止規則的實驗。

ScriptWalker 的 CRO 服務怎麼收費?

CRO 實驗導入包 NT$80,000 起、CRO 月費顧問 NT$25,000/月起;低流量網站另有 CRO 稽核方案 NT$35,000 起。

下一步

先用上面 12 題自評。若卡在「所需天數」,你需要的不是實驗工具,而是一份誠實的 CRO 稽核。30 分鐘免費諮詢,我們用你的實際流量算一次樣本數,當場告訴你該做 A/B 還是質性研究。

分享: