跳到主要內容
10 章/共 12 章複利

實驗系統:把觀察轉成假設,把結果留成組織知識

實驗讓團隊在可控風險下辨識因果、修正假設並留下決策紀錄。這一章會完成假設、曝光、主要指標、護欄、有效性檢查與結果摘要(readout)。

難度
進階
閱讀時間
22 分鐘
實作時間
120 分鐘完成實驗計畫
更新日期
2026-08-20

01學習目標

完成本章後,你能做到

  1. 把觀察與解法改寫成可反駁的假設
  2. 依流量、風險與問題選擇合適的驗證方法
  3. 建立包含負結果與未知的決策紀錄

02核心框架

觀察 → 解釋 → 測試 → 決策

先以證據描述問題與可能機制,再選擇能降低關鍵不確定性的最小測試。

  1. 觀察

    保留量化與質化證據,不急著下因果結論。

  2. 解釋

    寫出機制、受眾與可被反駁的預期。

  3. 測試

    依流量、風險與成本選方法與防護指標(guardrail)。

  4. 決策

    選擇停止、維持、擴大或重新研究。

03逐步拆解

先讀判斷依據,再照步驟完成工作產物。

複利

把實驗、知識與自然能見度累積成長期資產。

假設要寫出作用機制與可能副作用

『把按鈕改綠色會提升轉換』只是預測。完整假設要包含哪個受眾遇到什麼阻力、改變如何作用、主要指標與可能副作用。

  • 每個假設附上支持證據與可能反證。
  • 主要指標只回答一個決策,防護指標保護毛利、退貨與技術品質。
  • 先定義成功、不確定與停止條件,避免看結果後改規則。

先判斷 A/B 測試是否適用

低流量、明顯缺陷、高風險付款或資訊缺漏,可能更適合可用性測試、原型、前後比較或直接修復。方法要配合問題與決策風險。

  • 明顯可及性、錯誤與合規問題直接修,不拿使用者當實驗組。
  • 低流量可用任務研究、截斷序列或更上游行為訊號降低不確定性。
  • 高風險變更先用原型、功能開關(feature flag)與分階段上線。

沒有決策紀錄,實驗就不會複利

團隊需要找到過去測過什麼、對誰、在什麼情境、結果如何,以及是否能泛化。只保存勝出截圖會製造倖存者偏誤。

  • 保留原始假設、版本、日期、樣本、品質問題與結果。
  • 區分支持、反對、不確定與無效測試。
  • 每次結論附適用邊界與下一個問題,不宣稱永久最佳實務。

04營運實作指南

準備資料、完成工作、留下驗收紀錄。

先備好輸入資料,照流程留下工作產物,再用量測結果與護欄決定下一步。每個欄位都應該能交給下一位負責人繼續處理。

工作情境

團隊看見商品頁轉換波動,設計、行銷與老闆各自提出一個解法。現在最缺的不是第四個點子,而是一個能排除雜訊、最後真的做出決定的測試。

本輪產物
一份可執行的實驗規格書(experiment brief),加上曝光 QA、停止規則、結果區間與部署決策紀錄(rollout decision log)。
建議時限
120 分鐘完成實驗計畫;執行期由流量、基準值、MDE 與風險決定。

會前要備妥的資料

  • 要做的商業決策與單一主要指標定義
  • 基準期間、符合資格的流量與事件品質檢查
  • 至少兩種獨立證據,例如漏斗、錄影、訪談、客服或搜尋紀錄
  • 假設的受眾、阻力、改變、作用機制與可能反證
  • MDE、檢定力、分流、停止規則與多次中途檢視(repeated looks)處理方式
  • 活動、價格、庫存、媒體、版更與其他同時發生的變動
  • 可接受的毛利、退貨、效能與技術防護指標(guardrail)
  • 責任矩陣:實驗負責人、實作負責人、品質驗證/資料負責人、分析負責人、部署負責人與商業決策人

執行流程

每一步都留下可接手的工作產物。

  1. 把觀察與解釋分開

    實驗負責人先寫可查證的現象,再寫可能機制。至少放入兩種證據,並保留一項會推翻目前解釋的反證。

    交付物
    證據卡(evidence card):訊號、客群、來源、時間範圍、可能解釋與未解矛盾。
    驗收
    『轉換低,所以 CTA 不夠明顯』不合格;前半是觀察,後半仍需要證據。
  2. 把解法寫成可反駁的假設

    實驗負責人與實作負責人用『對哪個受眾,改變什麼,預期影響哪個指標,因為什麼機制』寫假設,同時標示不該受影響的防護指標。

    交付物
    假設卡(hypothesis card)與對照版/變體(control/variant)變更清單。
    驗收
    一次只改能回答這個機制的內容;若同時換版型、文案、價格與優惠,就無法留下可重用的學習。
  3. 在看結果前寫好決策規則

    分析負責人先定義納入資格、流量分配、主要指標、MDE、檢定力、執行條件、停止規則、防護指標與無效測試條件,再由商業決策人簽核。

    交付物
    已簽核的實驗計畫與樣本/執行期規劃。
    驗收
    不能把 95%、兩週或每版 1,000 人當固定配方;所需樣本要回到基準、MDE、設計、流量與風險。
  4. 先驗曝光與事件,再解讀提升幅度

    品質驗證/資料負責人確認曝光互斥、樣本比例合理、版本與事件可對回,並註記活動、庫存、媒體或版更;分析負責人通過資料品質後才解讀結果。

    交付物
    驗證紀錄、結果區間、分群部署矩陣與決策紀錄。
    驗收
    結果頁必須保留無效、負向與不確定測試;只存勝出版本截圖會讓知識庫失真。
  5. 分批部署並保留回復路徑

    部署負責人依簽核決策先上限定客群或流量,記錄部署後監測窗、停止條件與回復版本。防護指標越界、錯誤率上升或主要事件對帳失敗時,立即回復並通知商業決策人。

    交付物
    部署紀錄:範圍、版本、負責人、開始時間、監測窗、停止條件、回復連結與最後決策。
    驗收
    另一位值班者能在不詢問作者的情況下找到回復版本、執行回復並確認事件恢復。

情境演練

把配送與退貨資訊移近購買按鈕,該不該全面上線?

商品頁的開始結帳率下滑。團隊想重做整頁,但客服問題與錄影都指向購買前找不到配送與退貨資訊。

查核證據

  • 客服案件反覆詢問到貨時間與退貨條件。
  • 錄影顯示部分手機使用者在購買按鈕與頁尾政策之間來回尋找。
  • 裝置別漏斗顯示問題集中在手機,但聚合報表看不出差異。
  • 測試期將碰到一次促銷,媒體與價格排程可能成為干擾因素(confounder)。
  • 目前曝光事件尚未核對對照版與變體是否互斥。

決策

不做整頁全面改版。先對符合資格的手機流量測試一項改變:在購買按鈕附近提供可展開、內容與正式政策一致的配送/退貨摘要。

實作

  1. 以購買轉換作主要指標,先寫下最低值得部署的效果與防護指標。
  2. 保持價格、優惠、CTA 與其他商品資訊不變,只調整資訊位置與展開方式。
  3. 上線前驗證版本曝光、購物事件與訂單可依實驗 ID 對回。
  4. 促銷期間若無法維持分流與條件一致,暫停或把該期間排除於既定分析計畫。
  5. 預先定義:支持機制才部署;防護指標惡化則拒絕;區間仍太寬則記為不確定,不硬判勝出版本。
  6. 若採限制部署,由部署負責人先上指定手機客群並監看完整轉換延遲;JavaScript 錯誤、事件對帳或任一防護指標超過預設門檻就回復原版。

驗收方式:先通過曝光與事件品質驗證,再依預先寫定的樣本與停止規則評估結果區間。若只有特定裝置或市場得到支持,輸出應是限制部署,而不是『全站勝出』。

這是教學情境,沒有虛構提升數字。若流量不足以回答因果問題,應改做可用性研究、原型驗證或直接修正明顯缺陷,不把不夠力的 A/B 測試包裝成證明。

看到這個訊號,下一步怎麼選

表格可左右滑動,依序查看訊號、判讀與處置。

訊號、判讀與處置決策表
訊號判讀下一步
主要指標上升,但毛利、退貨或訂閱附加率惡化局部轉換改善不等於商業結果更好;這正是防護指標要攔下的情況。依預先規則拒絕或限縮部署,檢查改變是否吸引了錯誤訂單或犧牲較高價值行為。
測試初期出現明顯勝出版本短期波動、新奇效應或多次中途檢視都可能放大信心。不要提前停;依實驗計畫中的曝光量、執行期與停止規則繼續。
結果不顯著,但區間已排除值得部署的效果不是『再跑久一點一定會贏』,而是目前改變缺乏商業價值。停止並保留學習,回到機制或改測更大的、仍可解釋的介入。
樣本比例、曝光互斥或事件對帳不通過這是無效測試,不是負向測試。停止結果解讀,修正實作與品質驗證;不得用受污染資料做部署決定。
只有一個關鍵客群得到支持可能是可解釋的異質效果,也可能是事後切太多客群的偶然結果。若客群是預先指定且機制合理,採限制部署;否則把它當下一輪假設。

量測規格

主要指標
符合資格且已曝光工作階段的購買轉換率
診斷指標
  • 版本曝光量與樣本比例失衡(sample ratio mismatch)檢查
  • 曝光、加購、開始結帳與訂單事件對帳率
  • 從配送/退貨摘要展開到下一步行為
  • 效果區間與預先定義 MDE 的關係
  • 依裝置、來源與市場的預先指定效果
護欄
  • 每筆訂單貢獻毛利與折扣成本
  • 平均訂單價值與訂閱附加率
  • 退貨、取消與客服案件
  • 頁面效能與 JavaScript 錯誤
  • 資料遺失、重複曝光與跨版本污染
至少拆看的切面
  • 手機/桌機
  • 新客/回訪客
  • 市場與幣別
  • 流量來源與活動
  • 商品類別或風險型態
  • 預先指定的受眾納入資格

工作表

實驗規格書與決策紀錄

開始前先填到能被另一位分析者重做判斷;結束後沿用同一份文件記錄結果、限制與部署。

保留欄位順序,貼上後即可分派負責人。

  1. 商業決策與決策負責人
  2. 實驗、實作、品質驗證/資料、分析與部署負責人
  3. 觀察、證據來源、客群與未解矛盾
  4. 受眾/阻力/改變/效果/因為
  5. 對照版、變體與唯一變因
  6. 納入資格、流量分配與曝光事件
  7. 主要指標與防護指標
  8. 基準值、MDE、檢定力/樣本規劃
  9. 開始、停止、無效測試與多次中途檢視規則
  10. 同期活動、庫存、價格、媒體與版更
  11. 結果區間、客群、決策、限制與下一題
  12. 部署範圍、監測窗、停止條件、回復版本、回復負責人與最後核准

來源說明

觀點從哪裡來,讀者可以自己查。

  1. A/B Testing: What It Is and How To Run A/B Tests (2026)

    Shopify · 平台官方 · 查閱於 2026-08-20

    用於對照版/變體、主要指標與有效性的基礎流程;文中的 95%、兩週與每版 1,000 人不是通用樣本政策。

  2. Testing for performance

    Shopify.dev · 平台官方 · 查閱於 2026-08-20

    用於效能防護指標與多次實驗室測試的方法;佈景主題建議不應直接當成所有 Headless 商店前台的實作規格。

  3. 借鏡假設、KPI、分流、停止條件與分群部署的案例結構;個案結果不當成 Tenten 成效或通用基準。

常見誤區

容易讓工作走偏的判斷

  1. 看到短期提升幅度(uplift)就提前停止,忽略樣本與新奇效應
  2. 同時改太多元件,結果無法形成可重用學習
  3. 只發布勝出測試,負結果與無效測試被遺忘

05行動檢查表

交付前逐項核對

  1. 用受眾、阻力、機制與預期寫出假設
  2. 附上支持證據與可能反證
  3. 選擇與流量、風險和成本相符的方法
  4. 事先定義主要指標、防護指標與停止條件
  5. 把結果、限制與下一步寫入決策紀錄

讓每次學習持續累積

把提升幅度、負結果與無法判定的結果都留進決策紀錄。

Tenten 可協助優先序、量測、實驗設計與月度 CRO 運作節奏。

建立實驗節奏

本章屬於電商成長實作路線圖,最後更新於 2026-08-20

回到完整路線圖