互联网公司的 AB 测试是怎么回事
第 6 课 · 第四问 · 字节一线业务人员也懂 AB 测试吗

数据至上的反面

同一家公司,同一套平台,同一批方法。在抖音是神器,在教育业务上量出来的全是噪音。差别全在人懂不懂这把尺子量不到什么。

接着上一课的问题,人人都用实验,会不会用过头

抖音教育业务用户够多一天几亿人打开用户够多用户是学校,签一个要几个月反馈够快划一下就是一次反馈反馈够快教学效果一学期才看得出结果能量化看多久、点没点赞,全是数结果能量化学习效果怎么量化,没人知道尺子量得又快又准量出来的全是噪音,还拿去过 OKR示意
同一把尺子,三个前提全有就是神器,全没有就是噪音。左右两边的三行是同一套方法要求的三个前提。

一篇报道

故事是这样的。

2022 年 7 月,界面新闻发过一篇写字节教育业务的报道1,英文标题我翻一下,大数据给字节创造过奇迹,现在它成了诅咒。

里面讲的事是这样的。字节在教育上投了大概一万人,做了二十来款教育 App。做法跟做抖音一样,数据驱动,快速迭代,OKR 周期很短,隔一阵就要拿数据过一次评审。

有一个叫 Aixue 的产品,做的是 AI 生成定制题库,卖给学校。报道里的说法是,这个团队从来没有足够的时间在下一次 OKR 评审之前签下足够多的学校来做 AB 测试。

OKR 评审的节拍 一个周期 签够学校、跑完一学期看效果 还没签够学校,评审已经过了五轮 示意
上面一条是评审的节拍,下面一条是一个实验真正需要的时间。节拍之间塞不下一个实验。据界面新闻报道1,刻度是示意。

你把这句话放到前五课的框架里看,它每一个字都对得上。

第 1 课讲,实验需要够多的用户随机切两半。教育产品的用户是学校,签一个学校要几个月,你没有「够多」。第 1 课还讲,要等一段时间看那个数。教学效果要一个学期才看得出来,但 OKR 评审隔一阵就来一次,你没有「等」。第 3 课讲,判官要代表长期目标。学习效果怎么量化?报道里的说法是,公司没法量化「社区活力」「内容质量」这种东西,于是员工倾向于挑容易量化的、肤浅的任务去做。

还有一句更直接的,一个前员工说,高级管理者也不知道自己在做什么。

我读到这篇的时候,说实话,有点被震到。不是因为字节犯了错,是因为这个错太工整了。它不是方法用错了,是同一套方法原封不动搬到了一个它的三个前提都不成立的地方。

三个前提

用户够多,反馈周期够短,结果能量化。抖音三样全有,一天几亿人打开,划一下就是一次反馈,看了多久点没点赞全是数。教育三样全没有。同一把尺子,在抖音量得又快又准,在教育量出来的全是噪音,而且噪音还会被拿去过 OKR。

动手试示意

这件事,能不能靠 AB 拍板

拖三个滑杆,把你手头的一个决策放进来。右边告诉你该不该拿 AB 当判官。

三个前提决定 AB 是神器还是枷锁。 这是教学框架,不是字节或 Kohavi 的原话。

2023 年 2 月,字节 CEO 梁汝波发了封内部信,把双月 OKR 改成了季度2。媒体报道的解读是,双月的数据驱动考核周期给员工带来了不安全感。这个只能算旁证,信本身没提 AB 测试,但方向是一致的,把节奏放慢一点。

一线懂不懂,三层答案

好,回到你问的那个问题,字节一线业务人员懂不懂 AB 测试。前五课下来,我的答案是三层。

答案
凭什么
几乎一定
平台门槛压到运营拖拽就能开,万物皆可 AB,每天新开 4000 个,是几万人在用(第 4、5 课)
懂方法
证不出
找不到一线自己讲怎么开实验的一手材料,也找不到写明要会 AB 的 JD;平台替你算显著性,你不需要懂它怎么算(第 5 课)
懂边界
至少那条线上没有
教育业务的报道说明,那个时间点那条业务线上,连高层都没有(本课)

我觉得第三层才是这整套课真正想讲的东西。

再绕回第 5 课那个故事。抖音取名,数据说第二,人选了它。那群产品经理做对的事,恰恰是第三层,他们知道下载量这把尺子量不到「长期认知」,所以他们没有让尺子替他们做决定。而教育那条线做错的,也恰恰是第三层,学习效果这把尺子根本还没造出来,就已经拿着数据在过 OKR 了。

同一家公司,同一套平台,同一批方法。差别全在人懂不懂边界。

回到第 1 课那把尺子

第 1 课我说,对照组是尺子,不是凑数的。现在我想把这句话补完。

同一段时间、同一个世界 同一天来的人 随机切一刀 一半看旧的别的全一样 一半看新的只差这一个改动 3.0%3.1% 运气,还是真的? 第 1 课的那张图

尺子量不到的东西,不是不存在。

你来判断

下面三个决策,哪个最不该靠 AB 测试拍板?

B。它三个前提都缺,用户少、周期长、结果难量化。A 和 C 都是抖音式的决策,用户多反馈快,正是 AB 的主场。这不是说 B 就不该做决策,是说 B 的决策得靠别的东西,访谈、小范围试点、专业判断,而且要承认它比 A 和 C 更没把握。

六课压成一段话。AB 测试是把同一时间来的用户随机切两半、只改一件事、比一个数、问这个差是不是运气。十个想法一个赢,所以它的大头是拦输家,顺带把「谁说了算」从级别变成数据。赢要看对判官、守住护栏,小胜会累加成复利,但每个实验自报的赢加起来一定比真实多。字节把这套东西做成了平台,分层正交让几万个实验同时跑,门槛压到运营自己能开,于是一线人员几乎一定在用。但抖音这个名字是第二名,教育业务是反面教材,这两件事讲的是同一个道理,数据给排名,人做决定,而人真正要懂的,不是显著性怎么算,是这把尺子量不到什么。

六课认识的词,一张表
第 1 课对照组 · 随机分流 · 显著性
对照组切两半里没改的那一半,同一段时间的平行世界,它是尺子本身
随机分流分组跟用户的任何特征都没关系,两边住的是同样的人
显著性这个差像不像运气;没显著 ≠ 没差,是分不出
第 2 课胜率 · HiPPO
胜率Google / Bing 约 10–20%,微软整体约 1/3,所以大头是拦输家
HiPPO屋里工资最高那个人的意见,实验替换掉的是「谁级别高谁说了算」
第 3 课OEC · 护栏 · holdout · 新奇效应 · Twyman
OEC判输赢的那个数,要代表长期目标
护栏指标不能变差的几个数,主指标赢 + 护栏破 = 不算赢
holdout留 5–10% 用户一年不动,量全年实验的真数
新奇效应两周测到的提升会衰减,旧习惯让新版一开始吃亏
Twyman好得反常的数字先当 bug 查
第 4 课分层 · 互斥 · 正交 · Libra
分层按实验改的东西分几层,每层都能用全量用户
互斥同层一个用户只进一个实验,改同一块地方的放同层
正交层与层之间各自独立随机,两边一减抵消
Libra字节实验平台,编程实验 + 可视化实验
第 5 课万物皆可 AB
万物皆可产品、算法、运营、文案、素材、名字都进实验;能证的是人人在用,证不出的是人人都懂
第 6 课三个前提
三个前提用户够多、反馈够快、结果能量化;全有是神器,全没有是噪音

这一课的数字从哪来

  1. 字节教育业务约 1 万人、约 20 款应用、OKR 短周期评审、Aixue 团队来不及在评审前签够学校做 AB、无法量化「社区活力」「内容质量」、前员工「高级管理者也不知道自己在做什么」:界面新闻 2022-07-04,单一来源的深度报道,正文已写明「报道里的说法」。
  2. 梁汝波 2023 年 2 月内部信双月 OKR 改季度、双月考核带来不安全感的解读:腾讯新闻 2023-02-22
  3. 「用户够多 / 反馈够短 / 结果能量化」三前提是从第 1、3 课原理归纳的教学框架,不是字节或 Kohavi 的原话。「三层答案」是对全课证据的判断,正文已逐层说明强弱。动手块里的判定是示意。

六课讲完了。想再看一遍整条线,回目录。