中盾观察
首页 / 数据方法 / 正文

数据会说谎:入门常见的四个误区

栏目:数据方法 | 约1014字 | 2026-09-02

看数据的人常有一种错觉:数字不会骗人。但数字本身不说话,说话的是选数字、算数字、画图的人。同一组数据,换一个口径,走势可能完全掉头。入门阶段最容易踩的坑,往往不是算错,而是没意识到自己已经站在坑边上。

第一个误区是只看平均数。某公司公布员工月薪平均1.8万元,听起来不错。但如果十个人里有一个拿10万,其余九个拿1万,平均数照样是1.9万。这时候中位数只有1万,更能说明多数人的位置。平均数对极端值极其敏感,而很多业务数据恰恰是长尾分布——少数头部贡献大部分量。下次看到“平均”二字,先问一句:中位数是多少,最大和最小差多少。

第二个误区是把走势的短期波动当趋势。月度数据上下跳几下,太正常了。零售额受节假日影响,招聘量受毕业季影响,连气温都能让用电数据走出锯齿。有人看到连续两个月下滑就喊“拐点”,第三个月反弹又改口。判断走势,至少要看同比而非环比,再拉长到12个月以上。一条线画在图上,先数数它有几个完整周期,再谈方向。

第三个误区是混淆相关和因果。夏天冰淇淋销量和溺水人数同步上升,两者高度相关,但吃冰淇淋不会导致溺水,真正的原因是气温。数据里两列数字一起动,可能只是共同受第三个变量驱动。做预测时尤其要小心:把相关当因果,模型在训练集上好看,换个场景就崩。方法上可以多问一句——如果我把A去掉,B还会变吗?

第四个误区是只看见活下来的样本。二战时统计学家沃德研究战机弹孔分布,发现机翼中弹多、发动机中弹少,军方想加固机翼。沃德说,该加固的是发动机——因为发动机中弹的飞机根本没飞回来。这就是幸存者偏差。放到今天,看用户评价、看成功案例、看留存数据,都容易只统计“还在的人”。那些沉默流失的、没被记录的,才是观察里最容易被忽略的部分。

还有一个常被忽视的点:口径变了,数据就换了张脸。同一个指标,统计范围从“全国”改成“重点城市”,从“含税”改成“不含税”,走势可以瞬间反转。有团队曾把月度活跃用户从“登录过”改成“登录并产生一次操作”,数字直接掉三成。这不是造假,是定义不同。所以看任何数据前,先翻到脚注,把口径、时间范围、样本量确认一遍。

这些误区不要求你成为统计学家,只需要养成几个小习惯:看到平均数就找中位数,看到走势就问周期,看到相关就找第三变量,看到样本就想想谁不在场。数据是工具,观察是动作,预测是结果。工具越清楚边界,动作越不容易变形。入门阶段,少一点“数据说了算”,多一点“数据怎么来的”,往往比多学一个模型更有用。