图表看多了,我总结出6条统计常识
做图表笔记久了,会发现一个现象:同一个数据,换种读法,结论能差出好几倍。不是数据变了,是读的人忽略了统计常识。我把过去一年在图表笔记栏目里反复用到的几条常识整理出来,每条都配一个自己遇到的小例子。
第一条,均值会骗人,要看分布。某个月平台作者日均发文量是3.2篇。听着还行。但把数据摊开看,中位数只有1篇,前10%的作者贡献了六成以上内容。均值被少数高产账号拉高了。如果只盯着3.2这个数做判断,很容易高估普通作者的活跃度。后来我在图表里加了一列中位数,走势就清楚多了。
第二条,看到百分比,先问基数。有次看到一条数据:某功能使用率环比增长200%。挺吓人。但基数是从0.3%涨到0.9%。绝对增量不到一个百分点。百分比在基数小的时候会放大波动,100%的增长可能只对应几个用户。我在图表笔记里习惯把绝对量和百分比并排放在一起,避免单看增长率产生误判。
第三条,相关不等于因果,要看有没有第三变量。夏天冰淇淋销量和溺水人数都上升,两者走势高度同步。但吃冰淇淋不会导致溺水。真正的变量是气温。数据分析里经常碰到两条线一起动,看着像有因果关系,其实背后有共同驱动因素。做观察时,我至少会问一句:有没有别的变量能同时解释这两条曲线?
第四条,预测要给区间,别给单点。有人问下个月阅读量能到多少。直接说50万,听起来干脆,但大概率不准。统计上更稳妥的做法是给一个区间,比如45万到55万,并说明置信水平。预测本身不是错,错的是把预测当成确定值。我在图表里画预测线时,通常配一条阴影带,提醒自己误差是常态。
第五条,同比和环比不能混着说。某产品2月活跃用户环比下降15%。有人拿这个说事,认为产品在衰退。但2月只有28天,还有春节假期,环比本来就会低。看同比,2月对2月,去年也是下降的,降幅还更大。同比看长期趋势,环比看短期波动,两个指标各有用处,混用就容易得出片面结论。
第六条,样本代表谁,比样本多大更重要。一份问卷收了5万份,数量不小。但打开一看,八成填答者来自一线城市、年龄在25到35岁之间。拿这个数据去推断全国用户偏好,就会有偏差。样本量大不等于代表性强。做数据观察时,我第一眼看的是样本来源和结构,不是样本量。这六条常识不复杂,但每次读图表前过一遍,能少踩不少坑。