统计图表小史:从霍乱地图到折线图陷阱
1854年伦敦苏豪区暴发霍乱,十天内死了五百多人。医生约翰·斯诺把每例死亡标记在地图上,发现死者密集围绕宽街的一处水泵。他把水泵把手卸掉,疫情很快消退。这张地图后来被反复引用,视为统计图表的早期典范——它把一张表格里几百行地址,压缩成一眼能看出的空间聚集。但斯诺本人没画什么花哨图形,他只是在地图上点了些黑条。真正让图表成为独立工具,还要等几十年。
统计图表的普及有个容易被忽略的前提:数据要先能被批量处理。19世纪中叶,各国开始定期人口普查,死亡率、出生率被逐月登记。没有这些数字,图表就是空壳。威廉·法尔在英格兰登记总署工作时,把霍乱死亡按年龄、职业、地区拆成表格,再转成柱状图和饼图。他做的饼图被维多利亚女王赏识,但今天回看,那些饼图的信息密度远不如一张简单折线。工具进步了,读图的门槛却没降。
一个常见问题是把“走势”当成“规律”。折线图连点成线,视觉上天然暗示连续和方向。比如某城市月度犯罪报案数从1月的320件降到3月的280件,再升到5月的310件。画成折线,看上去像“先降后升”的V形。可这三个数很可能只是季节波动,或者报案渠道变更导致的统计口径变化。把三个点连起来做预测,误差往往比想象大。更稳妥的做法是拉长到36个月,看每年同期的位置,而不是盯着最近三个点。
第二个问题是纵轴截断。柱状图从0开始是常识,但很多图表为了“突出变化”,把纵轴起点设在接近最小值的位置。某公司季度营收从98万到102万,纵轴从95万起,柱子高度差看起来像翻倍。读者若只看图形,会以为业务暴涨。观察这类图,先看纵轴刻度,再看有没有截断标记。折线图截断纵轴有时可以接受,因为折线主要看走势斜率,但柱状图截断几乎必然放大差异。
第三个问题涉及平均数。单一平均数会掩盖分布。某地统计居民通勤时间,平均32分钟,听起来尚可。但拆开看,一半人少于15分钟,另有约两成人超过60分钟。平均数被短途通勤者拉低,长距离通勤者的处境在平均值里消失了。箱线图或分位数图能补上这个缺口:中位数、四分位距、异常值各自归位。图表不是越简单越好,而是要和你要回答的问题匹配。
第四个问题是色彩和比例。饼图超过五块,人眼就很难比较角度。有实验让受试者判断两个饼图里同一类别的占比,正确率在四块以内约七成,到八块时跌到四成左右。更麻烦的是3D饼图,透视变形让前面的扇区显得更大。同样的数据,换成水平条形图按大小排序,判断正确率能回到八成以上。工具的选择本身就在影响读者能读出什么。
回头看,统计图表的历史是一部压缩史:把成千上万个数据点压成一张图,让人快速观察整体形态。但压缩必然丢信息。斯诺的地图丢了时间维度,法尔的饼图丢了分布细节,今天的实时看板丢了数据来源的说明。读图的人如果只记住曲线形状,不做反向拆解,就容易把图表当成结论。更好的习惯是:看到一张图,先问数据从哪来、样本多大、纵轴怎么设、有没有更细的分组。这些问题不复杂,却能挡掉大半误读。
图表不会说谎,但会引导。从霍乱地图到今天的疫情走势图,工具换了十几代,人脑处理视觉信息的习惯没怎么变。承认这一点,比追求更炫的可视化更有用。