中盾观察
首页 / 图表笔记 / 正文

别急着下结论:三个统计常识的日常用法

栏目:图表笔记 | 约1139字 | 2026-09-11

看图表的时候,人容易犯一个错:把一条线当成一个故事。比如某平台公布过去十二个月的活跃用户数,从1月的8200万降到12月的7300万,标题写“用户流失加剧”。但把月度数据摊开看,7月是低点6900万,之后其实在回升。全年净减900万,可走势不是一路向下。这就是第一个常识:看趋势之前,先确认起点和终点是不是挑出来的。

第二个常识跟“平均”有关。某城市公布居民月收入中位数是5800元,同时平均值是9200元。两个数差这么多,说明高收入群体把平均值拉上去了。如果只用平均值做判断,会得出“大多数人收入接近九千”的错误印象。中位数和平均值放在一起看,才能感觉到分布的形状。图表里如果只画一条均值线,最好在旁边标一下中位数,或者补一个四分位区间。

再举一个更隐蔽的例子。某款App的次日留存率是45%,行业报告里写“高于平均水平”。但报告没说的是,这个数字来自“完成注册并绑定手机号”的用户,而那些打开就走的用户根本没进分母。统计口径一变,45%可以变成28%。所以看到任何比率,先问三个问题:谁被算进去了,谁被排除在外,时间窗口从哪到哪。这三个问题不解决,后面的分析和预测都站不住。

幸存者偏差是第三个常被忽略的点。二战时统计学家沃德检查返航飞机的弹孔分布,发现机翼中弹最多,发动机最少。最初的想法是加固机翼,沃德却说应该加固发动机——因为发动机中弹的飞机根本没回来。这个逻辑放到今天一样成立。比如你观察十个创业公司,发现七个创始人都有某类背景,于是得出结论“这种背景更容易成功”。但那些同样背景却失败的公司,你根本看不到。数据里的“存活样本”会系统性地偏斜。

日常做观察笔记,可以养成一个习惯:每看到一个结论,先找它的分母。某地交通事故死亡人数下降了12%,听起来是好事。但如果同期该地常住人口减少了15%,那死亡率其实在上升。分子和分母各自怎么变,比单独看一个百分比更有信息量。很多图表只给百分比,不给绝对数,这时候至少要留意一下基数有没有变化。

还有一个容易踩的坑是把相关当因果。冰淇淋销量和溺水人数在夏天同步上升,两者都受气温影响,不是冰淇淋导致溺水。做预测的时候,如果只靠历史数据的相关性做外推,遇到结构变化就会失效。2020年之前很多线下零售的月度数据有稳定的季节性,之后那套规律就断了。所以看到走势拟合得很漂亮的曲线,多问一句:这条线依赖的假设,今天还成立吗?

这些常识不复杂,难的是每次都记得用。建议在图表笔记里固定加两栏:一栏写“这个数是怎么算出来的”,另一栏写“如果口径变了,结论会不会反过来”。两栏各花两分钟,能挡掉大部分误读。统计不是用来证明谁对谁错的,它只是帮我们把观察落到更具体的地方——分母是什么,样本怎么来的,时间窗口有多长。把这些写清楚,比多画三条趋势线有用。