平均数和中位数,为什么总打架
整理后台留言时,发现一个反复出现的问题:同样的数据,为什么不同的人算出不同的结论?最常见的场景是收入。某城市公布去年城镇单位就业人员年平均工资为12.8万元。评论区立刻有人说,我身边没几个人达到这个数。两边都没说谎,分歧出在用了哪个指标。
平均数把所有人的收入加起来,除以人数。中位数把所有人从低到高排队,取站在正中间那个人的收入。假设一个十人小组,九个人月薪五千,一个人月薪十万。平均数是一万四千五百,中位数是五千。平均数被那个高收入者拉了上去。中位数告诉你,一半人低于五千,一半人高于五千。两个数字,描述的是同一组数据的两个侧面。
什么时候看平均数,什么时候看中位数,取决于你想回答什么问题。如果关心总量,比如一个地区的消费总盘子、税收总额,平均数更合适,因为它保留了每个观测值的权重。如果关心典型个体的处境,比如普通人月收入多少、房价对中等家庭的压力有多大,中位数更接近真实体感。国家统计局在发布居民收入时,同时公布平均数和中位数,原因就在这里。
同样的逻辑出现在很多领域。看网站访问时长,平均数可能被少数停留几小时的用户拉高,中位数反映的是大多数人的真实停留。看订单金额,平均数受大额订单影响明显,中位数则稳定得多。一个实用的观察习惯是:拿到一组数据,先把平均数和中位数都算一遍,如果两者差距很大,说明分布偏斜严重,这时候只报其中一个,都有误导的风险。
有人会问,那到底该信哪个?答案是看分布形状。数据接近对称分布时,平均数和中位数差不多,用哪个都行。数据明显偏斜时,比如收入、房价、阅读量、点赞数,这些指标天然右偏,少数极端值把尾巴拉得很长,中位数更稳健。但稳健不等于正确,它只是对极端值不敏感。如果你恰恰关心极端值的影响,比如平台头部创作者的贡献占比,那平均数反而更有信息量。
还有一种常见误解,是把平均数当成预测工具。比如看到某只基金过去三年的平均年化收益是百分之八,就认为未来也能拿到百分之八。这是两回事。历史平均数描述的是过去已经发生的走势,预测未来需要考虑的因素远不止一个历史均值。统计常识里有一条:平均数对过去的代表性,取决于分布是否稳定。如果分布本身在漂移,过去的平均数参考价值就有限。
类似的坑还有不少。百分比的平均不能直接取算术平均,要看权重。增长率连续两年的平均值,应该用几何平均而不是算术平均。样本量太小时,中位数可能比平均数更不稳定,因为中间那个值换一个人就变了。这些细节听起来琐碎,但实际工作中,一个指标选错,后面的结论就跟着偏。
写这些不是要否定某个指标,而是想说,数据本身不会说话,说话的是选择。下次看到一份报告,不妨多问一句:它用的是平均数还是中位数,样本分布大概什么样,极端值有没有被单独处理。多问这一句,很多看似矛盾的结论,就能找到各自的解释。
方法上的谨慎,比结论上的热闹更有用。观察一组数据,先从理解它的分布开始。