中盾观察
首页 / 图表笔记 / 正文

同一组数据,两种读法:统计常识对比

栏目:图表笔记 | 约1086字 | 2026-09-16

同一张折线图,两个人能读出完全相反的结论。这不是谁不诚实,而是统计常识里最常见的分歧:我们盯着的往往是同一个点,却忘了它周围还有一片区间。

先说点估计和区间估计。某市公布上月失业率为5.2%,前一个月是5.0%。如果只看这两个数,很容易写成“失业恶化”。但统计局同时给出抽样误差范围,5.2%的置信区间可能是4.8%到5.6%。两个月的区间大幅重叠,意味着这点变化完全可能是抽样波动。国家统计局每月发布的城镇调查失业率,样本覆盖约12万户,这个规模下0.2个百分点的跳动属于正常范围。把点估计当铁板钉钉的事实,是最常见的误读。

再看走势和预测的区别。走势是已经发生的数据连成的线,预测是从这条线往外推的延长线。很多人看图时把两者混为一谈。比如某平台月活用户从1月的8000万涨到6月的1.1亿,半年增加3000万。如果按这个斜率直接外推,年底就是1.4亿。但真实数据往往不是直线:2023年某短视频应用的月活在上半年增长12%,下半年只增长3%,因为新增用户触顶、获客成本上升。走势告诉你过去发生了什么,预测则依赖假设,而假设会变。看任何带预测的图表,先找那条延长线是用什么模型画的,比看结论更重要。

相关与因果的混淆,是另一个高频陷阱。有观察发现,冰淇淋销量高的月份,溺水事件也多。两个数据确实同步上升,但原因不是冰淇淋导致溺水,而是夏天到了。统计上,这叫遗漏变量。再比如某城市地铁客流与空气质量指数呈负相关:客流越高,空气质量指数越低。听起来像地铁改善了空气,实际更可能是下雨天——下雨压低空气质量指数,同时把更多人赶进地铁。相关系数只能说明两个数据一起动,不能说明谁推动谁。要判断因果,至少需要控制变量、找自然实验,或者看时间先后。

口径和基期同样能改变结论。2023年某省公布GDP增长5.5%,用的是不变价;如果换成现价,可能只有3%出头。同一份数据,按可比口径和按公布口径能差出两个百分点。基期选择更微妙:2022年基数低,2023年增速自然好看;把基期换成2019年,曲线立刻平缓。看任何同比数据,先问一句“跟谁比”。国家统计局在发布CPI时同时给出同比和环比,就是因为单看一个会失真。

这些常识落到日常看图,可以变成三个习惯。第一,看到点估计先找误差范围,没有区间就默认它不精确。第二,看到走势先问拐点在哪,别把最近三个月的斜率当永久趋势。第三,看到两个数据同步,先列出可能的第三种解释,再决定要不要说“导致”。

统计不是给结论盖章,而是给不确定性标价。同一组数据,读法不同,结论不同。把区间、口径、基期和因果这四件事放在手边,很多看似惊人的发现,会回到它本来的大小。