数据观察中的五个常见误区
做数据观察的时间越长,越会发现很多错误不是技术问题,而是习惯问题。下面这五个误区,是我在零售、社交和电商类数据里反复见到的。
第一个误区:基数太小就下结论。某新功能上线首日,10个用户里3个点击,点击率30%。第二天20个用户里4个点击,点击率20%。看起来跌了三分之一,但样本量太小,置信区间宽得能装下整个太平洋。更稳妥的做法是等到样本量过百再比较走势,或者用贝叶斯方法给出概率区间。我见过一个团队因为首日数据好就宣布成功,结果一周后回归到8%左右,白白浪费了推广资源。
第二个误区:忽略周期和外部事件。连续三周,某生鲜平台的订单量每周三都明显低于周二。有人归因于“用户周三忙”,但拉出三个月的观察,发现每个周三都有小促销结束后的回落。再比如,某社交App的日活突然涨了15%,查了半天,原来是当天有热门游戏开服,用户顺手打开了App。如果不把周期和外部事件纳入观察,就很容易把正常波动当成趋势反转。一个实用的习惯是:任何走势异动,先问“上周同一天、上月同一天是什么水平?”
第三个误区:把相关当因果。数据里两个变量一起动,不代表一个导致另一个。比如发现“冰淇淋销量”和“游泳馆人数”高度相关,这显然不是冰淇淋把人推进泳池。更隐蔽的例子:某电商发现“使用优惠券的用户客单价更高”,于是决定给所有人发券。但真实原因是高客单价用户更倾向于主动领券。用回归控制收入水平后,优惠券的效应几乎消失。做预测时,如果只依赖相关性,模型在环境变化后很容易失效。判断因果需要随机实验或至少准实验设计,比如双重差分、断点回归。
第四个误区:对预测过度自信。很多团队做预测时只给一个点估计,比如“下个月销量120万”,却不给区间。实际上,时间序列预测的误差常常在10%到30%之间。一个更诚实的做法是给出80%预测区间,比如“90万到150万”。我见过一个库存案例,因为只按点预测备货,结果实际销量落在区间下沿,导致积压。另一个问题是忽略预测的时效性:用三个月前的模型预测下周的走势,准确度会明显下降。定期用新数据重新校准,比追求复杂模型更重要。
第五个误区:只看单一指标。日活涨了,但用户停留时长跌了;GMV涨了,但退货率翻倍了。单一指标容易制造虚假繁荣。某内容平台曾庆祝“人均阅读篇数”提升20%,后来发现是因为推荐算法把长文拆成了多篇短文,实际阅读字数反而下降。做数据观察时,最好同时看三个维度:规模(如用户数)、质量(如留存、时长)、成本(如获客成本、服务器开销)。三者一起看,才能判断一个走势是健康还是虚胖。
这些误区没有一个是新问题,但每一个都会在压力下重现。避免的方法不复杂:多问一句“样本够吗”“周期对吗”“因果成立吗”“预测区间多宽”“其他指标呢”。把这几句话变成观察清单,至少能避开一半的坑。