别被平均数带偏:三个数据观察的教训
做数据观察这些年,我越来越怕看到报告里只放一个平均数。不是说平均值没用,而是它太容易让一个复杂的故事变得扁平,甚至完全颠倒。上个月帮一个朋友看他们线下门店的客流数据,全国平均到店人数是每天320人,看起来挺稳。但把门店按城市线级拆开,一线城市平均掉了12%,三线及以下涨了9%。如果只看总数,会得出“客流平稳”的结论,而实际上一线的团队已经在悄悄失血。平均数把两个方向相反的趋势对冲掉了,这就是最典型的平均值陷阱。
更隐蔽的一种情况,是辛普森悖论。去年我追踪过一个内容平台的数据,整体看,用户停留时长和广告曝光量是正相关的——曝光越多,停留越长。但按内容品类分组后,每个品类内部都是负相关:曝光多了,用户反而更快划走。原因在于,长视频品类天然停留长、曝光也多,把整体趋势拉成了正。这种反转在业务里很常见。比如一个App整体转化率在上升,分新老用户看,新用户转化涨了,老用户也涨了,但整体却跌了——因为低转化的新用户占比突然变大。遇到这种走势,别急着做预测,先把分组维度找出来。
双峰分布是另一个让我吃过亏的地方。前年分析一个工具类产品的使用时长,平均每天23分钟,团队觉得用户粘性还行。后来画了分布图,发现根本不是正态:一个峰在3到5分钟,另一个峰在50分钟以上。中间那段几乎是空的。这意味着什么?大部分人是偶尔打开查个东西就走,少部分重度用户把它当工作台。平均23分钟既不代表轻度用户,也不代表重度用户,它只代表一个不存在的“中间人”。如果按这个平均数去设计功能,两边都不讨好。后来他们拆成两条产品线,轻度用户做快捷入口,重度用户做工作流整合,次月留存才真正动起来。看数据,尤其是看用户行为数据,分布形态比均值重要得多。
还有一个老问题:幸存者偏差。我们能看到的数据,往往只是活下来的那一部分。比如你统计一个渠道的广告点击率,发现某个素材点击率高达8%,于是加大投放。但你不知道的是,这个素材在曝光不足100次的小号上跑出来的,大量曝光为0的样本根本没进报表。再比如,你分析付费用户的行为,发现他们平均每天打开App 6次,于是得出结论“多打开就会付费”。可那些打开次数更多但从未付费的用户,可能早就卸载了,根本没进入你的数据表。做趋势观察时,先问一句:这个数据里,谁被漏掉了?
那怎么办?我自己的习惯是,拿到任何一组数据,先做三件事。第一,不看均值看分位数。P50、P75、P90分别是什么,比平均数有信息量。如果P50和均值差很远,说明分布偏得厉害。第二,强制自己做至少一个分组。按地区、按新老、按渠道,哪怕按星期几,都可能看到不一样的东西。第三,找流失样本。每个环节的转化率,分母里包含了谁,分子里又少了谁。把这三步做完,再去看走势和预测,心里会踏实很多。
举个例子。之前看一个SaaS产品的月活跃数据,平均每个企业账号月活15人。听起来不错。分位数一看,P50只有4人,P90是60人。分组再看,100人以上的大客户贡献了绝大部分活跃,但这类客户只占账号总数的7%。更关键的是,过去半年新增账号里,小客户占比从60%涨到了82%,而小客户的P50活跃只有2人。这意味着,整体平均数被大客户撑着,但新增走势已经在往下走。如果只看平均数,会以为产品在稳步增长;拆开看,其实是结构在恶化。后来他们调整了获客策略,不再盲目追小客户数量,而是看激活率和留存。
平均值不是错,错的是把它当成唯一真相。数据观察做久了会发现,真正有用的信息往往藏在分布、分组和那些没被记录下来的样本里。每次看到“平均”两个字,不妨多问一句:谁被平均了?谁没被算进去?这两个问题,能帮你避开大多数陷阱。