互联网公司的 AB 测试是怎么回事
第 2 课 · 第一问 · 互联网公司的 AB 测试是怎么做的

大部分想法是输的

大公司里经过评审、排了优先级、真的做出来的想法,十个里也只有一个能赢。所以 AB 测试的大头不是找赢家,是拦输家。

接着上一课的问题,按这套方法老老实实比下来,想法有几成是赢的

十个经过评审、真的做出来的想法 1 2 3 4 5 6 7 8 9 10 赢了没差别变差了 示意 · 按 Google / Bing 的 10–20% 与微软的 1/3 变差画
十个想法一个赢,专家也一样。所以实验的大头是拦住那三个会让产品变差的,而不是找那一个亮的。

2012 年,Bing 一个躺了六个月的想法

故事是这样的。

2012 年,微软 Bing 有个员工提了个想法。搜索结果页上的广告,标题下面有一行小字,他说,能不能把那行小字的一部分挪上去,跟标题拼成一行,标题变长一点。

就这么一个改动。提出来以后,没人觉得它重要,在待办列表里躺了六个多月1。后来一个工程师看了一眼,觉得这代码没几行,顺手做了一个 AB 测试。

上线几个小时,新版那边的收入高得不正常,系统直接报了一个「好得不像真的」警报。这种警报平时基本都是埋点坏了、数据算错了。这次不是。

算下来,收入涨了 12%。光美国市场,折成一年就是 一亿美元以上。而且用户体验那一侧的指标一个都没变差。

旧版广告 新版广告 · 标题拼长一行 收入 +12% · 美国年化 1 亿美元以上
改动只有一处,把小字的一部分拼进标题。据 HBR 20171,线条是示意,不是真实页面。

我第一次看到这个案例的时候,反应跟大多数人一样,卧槽,AB 测试这么神。

但 Kohavi,就是当时微软实验平台的负责人,后来把这个案例写进 HBR 的时候,他想说的重点不是「AB 测试很神」。是另一件更扎心的事。

这个一年一亿美元的想法,在那六个多月里,所有人都觉得它不值得做。

你想想看,一群做了很多年搜索广告的专家,天天盯着这个页面,没有一个人看出来这是金矿。不是他们蠢,是这东西真的没法靠看出来。

十个想法,一个赢

Kohavi 他们在同一篇文章里给了一组数。Google 和 Bing 的实验,大概只有 10% 到 20% 能跑出正向结果。微软整体,三分之一有效,三分之一没差别,三分之一变差1。他们自己的比喻是,你得亲很多只青蛙才能亲到王子。

后来有人把各家公开过的数字拼在一张表上。

微软整体33%
Bing15%
Booking.com10%
Google 广告10%
Netflix10%
Airbnb 搜索8%

各公司实验的正向率。蓝色是中位数附近的三家。二手汇总2,单个数字别太较真,方向是一致的。

十个想法,一个赢。

我第一次认真看这组数的时候是有点懵的。因为这些不是随便什么想法,是 Google、Netflix 这种公司里最聪明的一帮人,经过评审、排了优先级、真的投入人力做出来的想法。就这样,十个里也只活一个。

那你说,为什么 Bing 15% 而微软整体 33%?我自己的理解是,越成熟的产品越难赢。Bing 的搜索页被几千个实验磨了十几年,容易摘的果子早没了,剩下的全是难啃的。一个新产品随便改改都能涨,一个老产品你得很用力才能动它 0.5%。这也是为什么大公司的实验要跑那么多人,第 1 课讲过,差越小,人越多才看得见。

大头不是找赢家,是拦输家

到这里我想停一下,因为我觉得这组数字真正该改变的,是你看 AB 测试的角度。

很多人把 AB 测试理解成「找赢家」的工具。测一下,找到那个更好的版本,上。

但如果十个想法九个不赢,那这件事的大头根本不在「找赢家」,在「拦输家」。三分之一的想法是会让产品变差的。这三分之一如果没有测,就直接上线了。每一个单独看都不大,0.3%、0.5%,但它们叠在一起,一年几十上百个,产品就是这么一点一点变糟的,而且你永远不知道是哪个改动干的。

动手试示意 · 随机模拟,胜率按微软口径

测不测,一年下来差多少

一年 100 个想法,三分之一赢、三分之一没差别、三分之一变差,赢一个记 +1,输一个记 −1。一条线是全都直接上线,一条线是测了只上赢的。按「再来一年」重新随机。

两条线的差,全是被拦住的输家。 赢家哪条线都有,实验多出来的那块价值是拦住的那些。

Bing 有 80% 左右的改动上线前会先跑实验1。不是因为他们觉得每个改动都可能是金矿,是因为他们知道每三个改动里有一个是地雷。

那我的判断还有什么用

说到这,我得讲讲对面的感受,因为我自己第一反应也是这个。

如果连专家的判断都只有一两成的命中率,那我作为一个业务人员,我的判断还有什么用?是不是以后什么都别想,全扔给实验?

我觉得不是,而且恰恰相反。

第一,想法还是人出的。Bing 那个一亿美元的改动,是一个人看着页面想出来的,实验只负责判,不负责想。没有想法,实验平台是空转的。十个想法一个赢,那你要赢得多,就得出更多想法,而不是出更少。

第二,实验解决的是另一个更麻烦的问题,谁说了算。Kohavi 他们给这个问题起了个词,HiPPO,Highest Paid Person's Opinion,屋子里工资最高那个人的意见。没有实验的时候,决策靠的是谁嗓门大、谁级别高。Bing 那个想法之所以躺了六个月,就是因为它在某个人的优先级判断里排在后面。实验把这件事变成了,你觉得行,我觉得不行,那就切一半流量试试。

Booking 那个设计负责人的说法我挺喜欢的3,每个决定都是民主的,但每个决定都要被测。

你来判断

一个团队今年跑了 30 个实验,4 个赢了,其他的没差别或者变差。老板看完觉得这个团队水平不行。你怎么看?

C。4 / 30 是 13%,正好在 Google、Netflix 的区间里,B 说的没错。但还差一层,如果这 30 个实验拦住了 10 个会让产品变差的改动,这个团队今年干的活比「4 个赢」看上去值钱得多。判断团队水平,得看想法的质量和数量,不是看胜率有没有过半。一个胜率很高的团队,反而可能是只敢测稳赢的东西。

还有一个坑,顺手说一下。「没变差,那就上吧」。一个实验没显著,团队说反正也没变差,上了。第 1 课讲过,没显著不是「没差」,是「分不出」。它可能真没差,也可能是差了 0.2% 但你的样本看不见。三分之一变差的改动里,有很多就是这么混进去的。

这一课,十个想法一个赢,专家也一样。所以 AB 测试的大头不是找赢家,是拦输家,外加一件事,让「谁说了算」从级别变成数据。

这课认识的两个词
胜率做出来的想法里,实验判定为正向的比例
Google / Bing 约 10–20% · 微软整体约 1/3 · 行业中位数约 10%
为什么看它它决定了实验的价值在哪。胜率低,拦输家比找赢家值钱。
胜率高不一定是团队强,可能是只测稳赢的;越成熟的产品胜率越低。
搭配第 3 课的 holdout
HiPPOHighest Paid Person's Opinion,屋里工资最高那个人的意见
没有实验时的默认决策机制
为什么提它实验真正替换掉的不是「直觉」,是「谁级别高谁说了算」。
HiPPO 不是坏人,Bing 那个想法被压六个月只是排优先级的人没看出来,专家也看不出来。
搭配Booking「每个决定都要被测」

这一课的数字从哪来

  1. Bing 2012 广告标题实验(躺了六个多月、几小时触发 too-good-to-be-true 警报、+12%、美国年化 $100M+)、Google 与 Bing 约 10–20% 正向、微软整体 1/3-1/3-1/3、Bing 约 80% 改动先跑实验:The Surprising Power of Online Experiments(Kohavi & Thomke, HBR 2017),原文已逐字核对。
  2. 六家胜率表:GrowthBook Blog 汇总,二手。
  3. Booking「每个决定都是民主的,但每个决定都要被测」,Stuart Frisby 说法:Medium,二手。
  4. HiPPO 一词见 Kohavi, Tang, Xu《Trustworthy Online Controlled Experiments》(2020)。「越成熟的产品越难赢」是我的解释。判断题里的 30 / 4 / 10 是示意数字。

下一课我们顺着赢家往下追。Bing 那个 12% 是个例外,大多数赢家赢得很少,1%、0.5%。那这些小胜利,加起来到底有没有变成公司真的赚到的钱?还有,选错了比的那个数,会跑出一种很吓人的「赢」。

赢了一次,公司真的赚到了吗?