换了张主图,第二天点击率涨了 18%,你截图发进群里说「这版好」。第四天涨幅掉到 3%,第七天变成 −2%。到底哪个数是真的?
答案通常是:一个都不是。因为在样本量还不够的阶段,涨跌几乎全是噪声。主图 A/B 测试真正难的地方不在选图,在于知道「跑到什么程度,这个结论才算数」——而这件事有公开的公式可以算,不用凭感觉。
下面这套算法和四条规矩,全部能追到公开出处:字节跳动火山引擎的 A/B 测试官方文档、Evan Miller 那篇被引用了十几年的《How Not To Run An A/B Test》、以及 NIST 统计手册。文末还有一张现算的样本量对照表,你可以拿自己的曝光量对一下,看看你的店到底测不测得动。
先问一句:主图值不值得花这么大力气测
值得,而且尺寸信息是最值得测的那一类变量。
Baymard Institute 对全球 60 家最大电商网站的商品页做过基准测试(Christian Holst,2017-05-30 发布),三个数字很说明问题:
- 56% 的测试用户进入商品页后的第一个动作,是先去看商品图,而不是读标题、读描述或往下滚。
- 42% 的用户会试图从商品图里判断这个东西的整体大小和比例。
- 但 28% 的网站,一张能看出比例的图都没有。
Baymard 的原话是,这类对商品尺寸的误判「frequently led users to wrongly discard perfectly relevant products and even resulted in site abandonments」——买家因为看不出大小而错误地放弃了本来完全合适的商品,有些人干脆离开了网站。
所以「主图上加不加实测尺寸标注」是一个值得认真测的变量。但注意:目前没有任何可靠的公开数据能告诉你「加尺寸标注能提升 X% 点击率」。 网上流传的那些百分比,追到源头基本都是厂商营销稿。这个数字只能你自己在自己的类目里测出来——这也正是要把测试做对的原因。
主图 A/B 测试到底是什么
先给一句能独立成立的定义:主图 A/B 测试,是把同一批流量随机分成两组,分别看到只有一处差异的两版主图,再用假设检验判断两组的点击率差异是不是真实存在,而不是抽样波动。 英文维基的 A/B testing 词条把它归为一种用户体验研究方法,并直接点出它的软肋:「A/B tests are sensitive to variance; they require a large sample size in order to reduce standard error and produce a statistically significant result.」
关键词是随机、只有一处差异、足够大的样本。这三条里少一条,结论就不成立。下面四条规矩,就是把这三条落到操作上。
规矩一:一次只动一个变量
火山引擎 A/B 测试的官方文档在讲广告实验时写得很直白:AB 实验需要控制变量。
听起来是废话,实际做起来最容易破功。你想测「加尺寸标注有没有用」,结果做第二版的时候顺手把背景换成了浅灰、把商品放大了一点、把字体也换了。跑完你只知道 B 版赢了,永远不知道赢在哪一处——下次做新品,你依然不知道该照抄什么。
这一步的现实困难是:靠手工修图做「只差一处」的两版图,几乎做不到,因为重新排版的过程本身就会引入第二个、第三个变量。真正能保证单变量的做法,是在同一张实拍底图上,用一套确定的几何标注把量出来的尺寸贴边锁上去,除此之外一个像素都不动,然后按同一套模板导出两个版本。这里的重点在「实测」两个字——标上去的数是卡尺量出来的,不是让 AI 看着照片猜一个「看着挺合理」的数字。测试要求两版之间只有一处差异,猜出来的数字连「差异是什么」都定义不了。这类标注在实物图上的呈现效果,可以看沙发尺寸标注的转化案例。
关于两版之间除了标注还该保持一致的东西,主图 5 张分别放什么里那套排位逻辑可以直接照搬——测试期间别动主图顺序。
规矩二:先算样本量,再开实验
Evan Miller 在 2010 年那篇文章里给出的第一条建议就是:「Decide on a sample size in advance and wait until the experiment is over.」 先定样本量,再开跑。
要算样本量,你得先定三个数:
| 参数 | 含义 | 常规取值 |
|---|---|---|
| 基准转化率 p | 你现在这版主图的点击率 | 从后台取过去 14–28 天的实际值 |
| 最小可检测提升 MDE | 小于多少的提升你根本不打算换图 | 相对提升 10%–30%,自己定 |
| 显著性水平 α / 统计功效 power | 容错设置 | α = 0.05(双侧)、power = 0.80 |
MDE 是最容易定错的一个。定得越小,需要的样本量涨得越猛。一个务实的判断:如果一版主图只能带来 5% 的相对点击提升,对绝大多数中小卖家来说根本不值得为它单独做一套素材,那就别把 MDE 定在 5%,定 20% 就好,样本量能省下一大截。
α = 0.05、power = 0.80 是行业通用默认值,也是 Evan Miller 那个公开样本量计算器的出厂设置(其公开脚本里写死的就是 alpha_level = 0.05; power_level = 0.80;,且默认双侧检验)。NIST 统计手册给的两比例样本量公式与之同源:所需样本量正比于 (z 值 × 标准差之和)² ÷ 差异²——分母是差异的平方,这就是为什么 MDE 减半、样本量要翻四倍。
样本量对照表:先看你测不测得动
下面这张表按 Evan Miller 公开计算器的原始公式算出(α = 0.05 双侧,power = 0.80),单位是曝光次数(即主图被展示的次数):
| 当前点击率 | 想测出的相对提升 | 目标点击率 | 每个版本需要曝光 | 两版合计 |
|---|---|---|---|---|
| 1% | +10% | 1.10% | 157,697 | 约 31.5 万 |
| 1% | +20% | 1.20% | 39,986 | 约 8.0 万 |
| 2% | +10% | 2.20% | 78,040 | 约 15.6 万 |
| 2% | +20% | 2.40% | 19,785 | 约 4.0 万 |
| 2% | +30% | 2.60% | 8,913 | 约 1.8 万 |
| 3% | +20% | 3.60% | 13,051 | 约 2.6 万 |
| 5% | +10% | 5.50% | 30,245 | 约 6.0 万 |
| 5% | +20% | 6.00% | 7,664 | 约 1.5 万 |
| 5% | +30% | 6.50% | 3,450 | 约 6,900 |
| 8% | +20% | 9.60% | 4,633 | 约 9,300 |
| 10% | +20% | 12.00% | 3,623 | 约 7,200 |
这张表读三遍,能省掉一整年的无效测试:
- 点击率越低,测试越贵。 1% 的基准点击率想测出 10% 的提升,两版合计要 31.5 万次曝光;同样的目标,5% 基准只要 6 万。所以新品冷启动期根本不适合做主图 A/B 测试,先把流量做起来。
- MDE 从 +10% 放宽到 +20%,样本量直接掉到四分之一。 2% 基准下是 15.6 万降到 4.0 万。放宽你愿意接受的判定门槛,比多花钱买流量便宜得多。
- 日曝光低于 1,000 的链接,别做 A/B 测试。 按 2% 基准、+20% MDE 算,你要跑 40 天才凑得齐样本量,这期间季节、大促、竞品早就把环境搅乱了。这种量级的店铺,把精力放在把尺寸信息补全上,比放在测试上划算——参考主图点击率翻倍的 7 个技巧里那些不需要样本量就能改对的地方。
规矩三:定了样本量,就不许提前看结论
这是杀伤力最大的一条,也是最反直觉的一条。
Evan Miller 的原话:如果你不是事先决定「这次实验就收集 1,000 个观测」,而是说「我们一直跑到看见显著差异为止」,那么所有报出来的显著性水平都失去意义(all the reported significance levels become meaningless)。
他给了一个具体到吓人的算例:基准转化率 50%,规则是「一看到 5% 显著就停,否则跑满 150 个观测」,那么你实际的假阳性率不是 5%,而是 26.1%——是你以为的五倍多。他还列了一张对照表:如果你在实验过程中偷看 10 次,那么你眼里的「1% 显著」实际上只相当于 5% 显著。文章末尾就四个字:no peeking。
火山引擎的官方文档把同一件事讲成了中文版:「在实验未达到预估样本量之前,显著性可能会在显著和不显著之间来回波动,过早决策的实验结论可能不可靠。」他们的建议是实验运行整数个完整自然周之后再做决策,理由很实在——多天累积指标本身天与天之间就有波动,周末和工作日的表现差异尤其大。
落到主图 A/B 测试上,就是两条硬规矩:
- 开跑前把「跑到 X 次曝光或满 N 个完整自然周」写下来,中途只看数据是否正常采集,不看胜负。
- 天数取 7 的整数倍。周三开跑周三结束,别周三开跑周日结束——你会把周末流量的结构差异当成主图的功劳。
规矩四:一次测三张以上,必须做多重比较
很多人一口气做五版主图一起测,谁高选谁。问题在于:每多做一次两两对比,你踩中假阳性的概率就叠加一次。
火山引擎文档给的算例很好记:A、B、C、D 四个版本两两对比共 6 组,只要其中一次判错,整个结论就算错,于是犯错概率变成 1-(1-5%)^6 = 26.5%,远大于你以为的 5%。同一份文档还提醒:开 100 次 A/A 实验(两组其实一模一样),也可能有 5 次得到「显著」的结果,这是抽样误差不可避免的产物。
实操建议:一次只测两版。 真要多版择优,就用平台提供的多重比较修正功能,或者分轮次做单挑赛——第一轮 A 对 B,赢家再对 C。慢,但结论是真的。顺带一提,火山引擎的广告实验对照组加实验组总数上限是 5 组,这个上限本身就是在提醒你别乱铺。
实验跑完,那个区间该怎么读
假设结果显示 B 版点击率提升的置信区间是 [1.5%, 4.5%],很多人读成「上线后至少涨 1.5%」。不是。正确读法是:在 95% 置信水平下,这个区间有 95% 的可能包含真实的提升幅度。上线后拿到的具体数字落在区间内任意位置都正常,落在区间外也不代表实验错了。
还有一种相反的错误:结果不显著,就一直延长实验,直到显著为止。理论上只要样本足够多,任何一丁点差异都会变成统计显著——但一个跑了半年、提升 0.1% 的「显著」结论,商业上毫无意义。判断标准回到你一开始定的 MDE:如果实验的灵敏度已经优于你设定的最低提升值,结论仍然不显著,那就承认这版图没用,换个变量重来。
如果你测的指标不是点击率而是退货率,样本量的算法完全一样,只是基准值换成退货率。测之前先用退货成本计算器算一笔账:退货率降 1 个点在你这里值多少钱,这个数会直接决定你的 MDE 该定在哪。
下一步:这周就能开的第一个实验
不用等一套完整的测试体系,按下面这份清单走一遍就能开跑:
- 取基准值:后台导出目标链接过去 14–28 天的主图点击率,写下来
- 定 MDE:问自己「涨多少我才愿意为这版图重做全店素材」,把这个数当 MDE,别低于 10%
- 查表定样本量:用上面那张表,确认你的日曝光量能在 2–4 个完整自然周内跑完
- 做两版只差一处的图:底图、构图、色调、裁切全部锁死,只改「有没有把实测尺寸标上去」这一处
- 写下停止条件:曝光数达标 + 满整数个自然周,两个条件同时满足才看结论
- 跑完再看:中途只检查数据采集是否正常,不看胜负
- 记档:把基准值、MDE、样本量、起止日期、结论一起存下来,下次测新品直接复用参数
工具上你有几种选择:只想跑一次的,用后台原生的创意测试功能加人工记录就够;要长期做的,可以上专门的 A/B 实验平台;而两版图本身怎么产出——如果测的变量是尺寸标注,就需要一个能在同一张实拍图上贴边取数、把实测尺寸锁死、再按各平台规格一键导出两个版本的工具,这样才守得住「只动一个变量」这条底线。
常见问题
主图 A/B 测试要多少曝光才有结论?
取决于你的基准点击率和想检测的提升幅度。按 α = 0.05 双侧、power = 0.80 计算:基准 2% 想测出 20% 的相对提升,每个版本约需 19,785 次曝光,两版合计约 4 万次;基准 5% 想测出同样的提升,两版合计约 1.5 万次即可。基准点击率越低,需要的曝光量越大。
主图 ab 测试怎么做才不出错?
四条:一次只动一个变量;开跑前先算好样本量并写下停止条件;中途不看胜负;同时测三个以上版本时做多重比较修正。前两条决定结论成不成立,后两条决定结论可不可信。
测了三天数据涨了,能提前结束吗?
不能。Evan Miller 的算例显示,把「跑到显著为止」当停止规则时,实际假阳性率可达 26.1%,是名义 5% 的五倍多;偷看 10 次的话,你看到的 1% 显著实际只相当于 5% 显著。火山引擎的官方建议是跑满整数个完整自然周再做决策。
最小可检测提升 MDE 是什么意思?
MDE 指这次实验能被检测出来的最小提升幅度。它应该等于你心里「低于这个数就不值得换图」的那条线。MDE 定得越小,所需样本量越大,且是按差异的平方反比增长——MDE 减半,样本量约翻四倍。
主图上加尺寸标注能提升多少点击率?
没有可靠的公开数据能给出这个数字,任何声称有确切百分比的说法都要先追问出处。能确定的是 Baymard 的基准研究结论:42% 的用户会试图从商品图判断商品的大小和比例,而 28% 的网站一张能看出比例的图都没有。具体提升幅度需要你在自己的类目里测。
日曝光只有几百的链接能做 A/B 测试吗?
不建议。按 2% 基准、+20% MDE 算需要约 4 万次曝光,日曝光 1,000 需要 40 天,期间大促、季节、竞品变动都会污染结果。这个量级更该做的是把尺寸、材质、规格这些信息在图上补全,而不是做统计检验。
来源与依据
- Baymard Institute — Product Page UX: All Products Need at Least One "In Scale" Image (28% Get It Wrong)(Christian Holst,2017-05-30;基于全球 60 家最大电商网站商品页基准测试:56% 用户首个动作是看图、42% 用户试图从图判断尺寸、28% 网站无任何比例参照图)
- 火山引擎 A/B 测试文档 — 开实验必看:A/B实验中常见的8个错误(未达预估样本量前显著性会来回波动;建议运行整数个完整自然周再决策;四版本两两对比犯错概率 1-(1-5%)^6=26.5%;100 次 A/A 实验可能有 5 次显著)
- 字节跳动数据平台 — 火山引擎DataTester分享:A/B实验中常见的8个错误(上述官方文档的同源公开版本,可直接查阅原文)
- Evan Miller — How Not To Run An A/B Test(2010-04-18;「跑到显著为止」会使报出的显著性失去意义;50% 基准、5% 显著阈值、150 观测上限的算例下实际假阳性率 26.1%;偷看 10 次时 1% 显著仅相当于 5% 显著)
- Evan Miller — Sample Size Calculator(本文样本量表所用公式与默认参数来源:α = 0.05 双侧、power = 0.80,可输入相同参数自行复现)
- NIST/SEMATECH e-Handbook of Statistical Methods — Sample sizes required (two proportions)(两比例检验的样本量公式,分母为待检测差异的平方)
- Wikipedia — A/B testing(A/B 测试对方差敏感,需要较大样本量才能降低标准误并得到统计显著的结果)
