中盾观察
首页 / 图表笔记 / 正文

平均值骗了你多少年

栏目:图表笔记 | 约1218字 | 2026-10-02

某招聘平台发布报告,说某城市平均月薪一万二。评论区立刻分成两派:一派说自己拖后腿,另一派说数据造假。其实两边都没说错,只是讨论的对象不同。平均值一万二,可能真实存在,但它描述的是一个被数学构造出来的抽象人,不是任何一个具体劳动者。要理解这件事,得回到统计最基本的问题:我们到底在测量什么。

先看一个简单的例子。假设一个五人小团队,月薪分别是四千、五千、六千、七千、八万。平均数是(4000+5000+6000+7000+80000)/5,等于20400元。中位数则是六千。两个数字差了三倍多。如果对外说平均月薪两万,听上去很体面,但团队里四个人都够不着这个数。中位数六千,才更接近大多数人的真实位置。收入、房价、资产这类分布极不均匀的数据,平均值天然容易被少数高值拉高。

分位数是另一个常用工具。把数据从小到大排列,处在百分之十位置的值叫十分位数,处在百分之五十位置的就是中位数。比如某城市二手房挂牌价,百分之十分位数是每平方米两万,百分之五十分位数是三万五,百分之九十分位数是八万。这三个数字放在一起,才能看出市场的层次:低价段、主流段和高价段各自什么水平。只报一个平均数,这些结构信息全丢了。

走势观察里也有类似陷阱。某指标连续三个月分别是100、102、104,看起来稳步上升。但如果第四个月是103,第五个月是101,趋势就变了。单看三个月,容易把短期波动当成长期方向。更稳妥的做法是拉长观察窗口,同时看同比和环比。同比消除季节因素,环比反映最新变化,两者结合,才不容易被单月数据带偏。

预测这件事,更需要克制。统计模型给出的预测,本质上是在一定假设下对未来的条件推断,不是承诺。比如用过去十年气温数据拟合一条曲线,预测明年平均气温,模型会给出一个数值和一个置信区间。区间越宽,说明不确定性越大。把预测值当成确定结果,是常见的误读。理性的态度是:看方向,看区间,看假设是否成立,而不是盯着小数点后一位。

加权平均也常被忽略。一个班级,男生平均身高175厘米,女生平均身高163厘米,全班平均身高不是两者的简单平均,而要考虑男女比例。如果男生占七成,全班平均就是175×0.7+163×0.3,等于171.4厘米。很多综合指数、价格指数都涉及加权,权重的选择直接改变结果。看到平均值时,先问一句:它是怎么算出来的,权重是什么。

做数据观察,有几个习惯值得养成。第一,看到平均值,顺手找中位数和分位数。第二,看走势,至少拉长到十二个月以上,并对比同比环比。第三,看预测,重点看区间和假设,而不是单点数值。第四,看任何汇总数字,先确认口径:统计范围是谁,时间窗口多长,权重怎么定。这四个问题问完,很多看似矛盾的数据,其实都能对上。

统计不是用来制造确定感的,它更像一套描述不确定性的语言。平均值、中位数、分位数、加权平均,各有各的用处,也各有各的盲区。把它们放在一起看,数据才会说话。下次再遇到一个漂亮的平均数,不妨多问一句:这个数,到底代表了谁。