關於 A/B 測試
成效媒體的機器學習越強,A/B 測試的成敗就越取決於決定「比較什麼」的品牌理解與實戰經驗。

廣告一上線,媒體就會自動找人、自動出價,並把預算自動集中到反應好的素材上。行銷人能親手調整的槓桿變少了,於是常有人問:「A/B 測試是不是也該交給媒體?」結論正好相反。機器學習越強,決定成效的反而是決定要拿什麼跟什麼比較的人,也就是真正理解品牌的創意與行銷團隊。
機器學習變強之後,A/B 測試有什麼不同?
可測試的變數從「給誰看」轉向「給什麼」。當 Meta 的 Advantage+ 購物廣告或 Google 的成效最大化這類自動決定受眾、出價與版位的廣告成為預設,把受眾切開來比較的測試就越來越沒有空間。行銷人親手輸入的變數中,最大的一項如今是素材。
但這不代表素材投得多就好。媒體只能從行銷人準備好的候選中挑選,候選的水準就是成效的天花板,而設計這組候選,仍然是人的工作。
| 項目 | 手動操作的時代 | 機器學習自動化的時代 |
|---|---|---|
| 主要測試變數 | 受眾、出價、版位 | 訊息、訴求、素材形式 |
| 最佳化的主體 | 行銷人手動調整 | 媒體演算法即時分配 |
| 行銷人的核心角色 | 設定與監看 | 假設設計與候選規劃 |
| 成效的瓶頸 | 人力與時間 | 值得比較的想法 |
媒體選出的「勝出素材」,為什麼不一定是正解?
因為機器學習只會朝我們餵給它的訊號最佳化,而那通常是點擊或購買之類的短期指標。品牌長年累積的語氣與長期認知並不在這些訊號裡。所以聳動的文案與過度的折扣訴求在短期轉換上容易勝出,一路跟著這種結果走,品牌最後只剩下折扣能喚起反應。
同一個廣告組合內的比較不是實驗
把多支素材放進同一個廣告組合,媒體會很快把預算集中到初期反應好的那一支。幾乎沒拿到曝光的素材不是輸了,而是根本沒被評估。要判斷素材優劣,必須另外使用能分開控管預算與曝光母數的分組測試功能。
機器學習只能從既有選項中挑出最好的一個,它不會替你創造選項。
那麼,究竟該測試什麼?
該測的不是按鈕顏色,而是品牌對顧客許下什麼承諾。細微的變數機器學習會自行篩選,但哪一種承諾才像這個品牌,只有懂品牌的人能決定。好的測試,是結果出來後會改變下一輪素材方向的測試。
| 項目 | 弱的假設 | 強的假設 |
|---|---|---|
| 比較對象 | 按鈕顏色 紅 vs 藍 | 「價格」訴求 vs 「省時」訴求 |
| 出發點 | 容易更動的東西 | 顧客選擇我們的理由 |
| 結果的用途 | 換掉一支素材 | 決定下一季的訊息方向 |
| 品牌準則檢核 | 沒有 | 測試前先篩選 |
需要品牌理解的地方有兩處:一是想得出值得比較的替代方案,二是即使數字贏了也要判斷哪些素材不能用。這兩件事都不在媒體數據裡。
如何把品牌理解轉化為測試設計?
從測試開跑前先寫下品牌準則開始。沒有準則就直接看結果,人會被數字好的那一邊牽著走;累積下來,品牌會越來越像媒體的演算法。
- 01
定義品牌準則
把該守住的語氣、不使用的說法、對顧客的核心承諾整理成一頁。
- 02
設計假設
從顧客選擇我們的理由中,挑出兩到三個要比較的訴求。
- 03
受控執行
用分組測試把預算、期間與曝光母數分開來跑。
- 04
解讀與落地
只有當你能用品牌的語言解釋為什麼會贏,才放大投放。
最後一步最關鍵。若說不出勝出素材為什麼會贏,這個結果就無法銜接到下一次測試。能說得出來,一次的勝利才會沉澱成團隊的經驗。
實際投放時有什麼不同?
在一個大型電商品牌的投放中,我們用兩週時間比較了 8 個訴求,轉換率提升了 28%p。預算與期間都沒有變,改變的只有「拿什麼來比較」。
這 8 個訴求並不是挑看起來成效好的,而是從品牌準則中篩選出來的。
28%p
轉換率變化
2 週
測試期間
8 個
比較訴求
想了解從品牌準則出發的素材測試設計
聯絡 CREATIP- A/B 測試
- 素材測試
- 成效行銷
- 廣告最佳化
