那個「提升 41%」的實驗,其實什麼都沒證明
客戶傳來截圖:新版 CTA 轉換率 3.1%、舊版 2.2%,「可以全量上線了吧?」我們問三題:跑幾天(4 天)、兩組樣本各多少(1,180 / 1,460)、中途看過幾次(每天早上)。三個答案各對應一個致命問題:樣本不足、分流比例失衡(SRM)、重複偷看造成偽陽性。代價在後面:團隊據此改了全站按鈕,三個月後營收沒動,沒人知道原因。
適用情境 × 不適用情境
| 適合做 A/B 測試 | 不適合做 A/B 測試 |
|---|---|
| 月轉換事件 ≥ 1,000 次 | 月轉換事件 < 200 次,實驗要跑半年以上 |
| 有單一北極星指標與事前假設 | 只想「看看哪個好看」 |
| 實驗期內頁面與環境穩定 | 正在改版、換金流、跑大檔促銷 |
| 有工程資源做伺服器端/SDK 分流 | 只能貼第三方 JS,又在意 Core Web Vitals |
| B2C、電商、SaaS 註冊漏斗 | B2B 高單價、月成交 5 筆 |
低流量網站正確做法是CRO 稽核 + 質性研究:5–8 位可用性測試、Microsoft Clarity 錄影與熱區、結帳逐步流失分析。小樣本下這些方法解釋力更高。
替代方案矩陣
| 方案 | 分流 | 統計 | 起始成本(NT$) | 主要風險 |
|---|---|---|---|---|
| GA4 + BigQuery 自算 | 自寫 flag | Python/R 自算 | 工具 0;查詢 500–3,000/月 | 需自建統計流程 |
| PostHog | SDK(前/後端) | 頻率論 + 序列檢定 | 免費額度後 3,000–15,000/月(定價) | 事件量大時費用跳升 |
| GrowthBook | flag,可純伺服器端 | 貝式 + 序列檢定(文件) | 自架 0,主機 1,500–4,000/月 | 需自顧 SDK 與倉儲 |
| Statsig | SDK + 伺服器端 | 序列檢定、CUPED | 免費額度大,超量按事件計 | 進階功能綁企業方案 |
| VWO / Optimizely | 視覺化編輯器 | 內建 | 年約 150,000 起;Optimizely 七位數 | 用戶端注入,CLS 風險最高 |
| Google Optimize | — | — | — | 2023 年 9 月停服(公告) |
完整流程拆解(5 階段 / 6–10 週)
- 階段 1:CRO 稽核與假設庫(1–2 週) 交付:漏斗逐步流失表、錄影摘要、20–30 條 ICE 排序假設。工具:GA4 探索、Microsoft Clarity、Figma、Notion。
- 階段 2:實驗設計與樣本數計算(3–5 天) 交付:實驗規格書(1 主指標 + 3 護欄指標 + MDE + 預計天數 + 停止規則)。工具:Evan Miller、GrowthBook 計算機。
- 階段 3:技術導入(1–2 週) 交付:feature flag 接上、伺服器端分流(Next.js/Laravel middleware)、分流 ID 寫入 first-party cookie、SRM 監控儀表板。
- 階段 4:執行與監控(3–7 週) 交付:每日 SRM 檢查、每週護欄指標(錯誤率、LCP、客服工單)回報;主指標封存不看。
- 階段 5:判讀與決策(3–5 天) 交付:效果量 + 信賴區間 + 分群拆解報告、上線/回滾決議。
真實成本完整拆解
| 項目 | 金額(NT$) | 說明 |
|---|---|---|
| CRO 稽核 + 假設庫 | 35,000 起 | 約 25–35 工時 |
| CRO 實驗導入包 | 80,000 起 | flag 架構、伺服器端分流、SRM 監控、首個實驗 |
| CRO 月費顧問 | 25,000/月起 | 每月 1–2 個實驗的設計與判讀 |
| 工具訂閱 | 0–15,000/月 | 自架可為 0 |
隱藏費用:
- 倉儲查詢費:BigQuery 超過免費 1 TB 掃描後計費,大站每月 500–3,000 元常見。
- 技術債:實驗結束不清 flag,半年成維護負擔(約 4–8 小時/季)。
- 效能代價:用戶端 anti-flicker snippet 擋渲染,推高 LCP 與 CLS(良好門檻 0.1),返工常比導入更貴。
- 機會成本:跑 7 週的實驗等於該頁面凍結 7 週。
- 判讀人力:每個實驗至少 6–10 工時。
實施真相 vs 客戶想像
| 客戶以為 | 實際發生 |
|---|---|
| 兩週就能看到結果 | 日流量 800、基準 2.4%、偵測 20% 相對提升(至 2.88%)每組需約 17,500 人、合計 35,000 人次,即 約 44 天(建議湊 7 整週)。只跑 14 天,只能偵測 35% 以上的提升 |
| 多開版本比較快 | 4 個版本共用流量,44 天變 約 88 天,多重比較讓偽陽性率由 5% 升到 14% |
| 每天看數字才能掌握進度 | 固定期程下每日偷看,實際型一錯誤率會被推到 20–30% |
| 贏了就代表營收會漲 | 註冊率贏、退款率同步上升很常見,沒護欄指標就看不到 |
| 工具裝好就有洞見 | 假設品質決定一切;沒有假設庫的團隊第三個月就沒題目 |
六個常見陷阱 × 解法
- SRM(分流比例失衡):說好 50/50 卻跑成 48/52,代表分流或追蹤有 bug,結果全作廢。解法:每日跑卡方檢定,p < 0.001 立即停下除錯(SRM checker)。
- peeking/看到贏就喊停。解法:事前寫死停止日期;需中途決策就改用序列檢定(GrowthBook、Statsig 內建 always-valid p-value)。
- 多重比較:同看 5 個指標,至少一個「顯著」的機率是 22.6%。解法:只設 1 個主指標,其餘為護欄,套 Benjamini-Hochberg 校正。
- 前端閃爍(FOUC)與版位位移:用戶端 JS 換內容會先閃舊版。解法:改伺服器端或 edge middleware 分流。
- 跨裝置身分不一致:同一人手機看 A、電腦看 B。解法:登入後以 user_id 分流,未登入用 cookie ID,固定 hashing seed。
- 新奇效應與週期性:新設計前三天總是好看。解法:一律湊滿整週,最少 14 天。
成功指標 + 90 天路線圖
- 第 30 天:flag 與伺服器端分流上線、SRM 每日綠燈、假設庫 ≥ 20 條、首個實驗跑滿天數。指標:LCP/CLS 無退化。
- 第 60 天:完成 2–3 個實驗判讀(含失敗案例)、建立新舊客與裝置分群拆解。指標:實驗完成率 ≥ 80%、每個實驗都有書面結論。
- 第 90 天:至少 1 個勝出變體全量上線並回測。指標:主漏斗相對提升 5–15%、每月穩定 2 個實驗、flag 債務為 0。
決策清單(12 題,全部「是」再開始)
- ☐ 月轉換事件 ≥ 1,000 次?
- ☐ 能說出唯一一個主指標?
- ☐ 已算出 MDE 與天數且能接受?
- ☐ 願意實驗期間凍結該頁面?
- ☐ 有 3 個護欄指標(錯誤率、效能、退款)?
- ☐ 能做伺服器端/SDK 分流,而非純 JS 注入?
- ☐ 有每日 SRM 檢查?
- ☐ 已事前寫下停止規則?
- ☐ 接受「沒效果也是結論」,不事後改指標?
- ☐ 有假設庫能產出下一題?
- ☐ 知道誰負責清 flag?
- ☐ 若要跑 3 個月以上,願意改做質性稽核?
常見問題 FAQ
日流量只有 200,還能做 A/B 測試嗎?
以 2.4% 基準計算,偵測 20% 提升要約 175 天,環境早就變了。把預算移到 CRO 稽核、可用性測試與漏斗修補。
Google Optimize 停掉後的免費替代方案?
GA4 的 BigQuery 匯出(免費)搭配自架 GrowthBook 成本最低,但需工程與統計能力;沒有工程資源就用 PostHog 或 Statsig 免費額度。
一定要用伺服器端分流嗎?
在意 SEO 與 Core Web Vitals 的話,答案接近「是」。用戶端分流需要 anti-flicker 遮罩,直接惡化 LCP 與版面位移。
實驗不顯著,是不是白做?
不是。「這個改動沒有 20% 以上效果」就是可行動的結論。真正白做的是沒假設、沒停止規則的實驗。
ScriptWalker 的 CRO 服務怎麼收費?
CRO 實驗導入包 NT$80,000 起、CRO 月費顧問 NT$25,000/月起;低流量網站另有 CRO 稽核方案 NT$35,000 起。
下一步
先用上面 12 題自評。若卡在「所需天數」,你需要的不是實驗工具,而是一份誠實的 CRO 稽核。30 分鐘免費諮詢,我們用你的實際流量算一次樣本數,當場告訴你該做 A/B 還是質性研究。
- Email:[email protected]
- 電話:0916-224-047
- LINE:@ufv9089p