从霍乱地图到动态面板:统计图表小史
把时间拨回1854年。伦敦苏豪区暴发霍乱,十天内死了五百多人。医生约翰·斯诺没急着写论文,他做了一件事:把每个死亡病例的位置标在街区地图上,用短横线堆叠表示人数。当黑色线条密集围绕宽街水泵时,传染源自行浮现。这张图后来被称为“霍乱地图”,它不解释因果,却让观察者自己看出因果。统计图表的历史,从这里可以算一个起点。
在斯诺之前,图表更多是几何装饰。1786年,苏格兰工程师威廉·普莱费尔发明了第一张真正意义上的折线图、柱状图和饼图。他当时关心的是英国与北欧的贸易数据,想在一页纸上同时展示进口、出口与税收。柱状图让不同国家的数值可以并排比较,折线图让时间上的走势变得连续。普莱费尔在《商业与政治图集》里写道,图表的目标是“让眼睛代替计算”。这句话放到今天依然成立。
折线图的普及和铁路、电报同步。19世纪中期,欧洲铁路公司需要追踪客运量和货运收入的月度变化。数字表格当然也能看,但一列三十个数字摆在眼前,人脑很难快速判断趋势。折线图把时间变成横轴,把数值变成纵轴,上升、下降、拐点一目了然。一个具体的例子:1861年,伦敦地铁的前身大都会铁路公司用折线图对比不同月份的客流,发现周末客流比工作日低约四成,于是调整了班次安排。图表第一次成为运营决策的固定环节。
散点图则要等到20世纪初才被系统使用。英国统计学家卡尔·皮尔逊在研究父子身高关系时,把每对数据画成一个点,横轴是父亲身高,纵轴是儿子身高。点云呈现出一条斜向的椭圆,相关系数的概念随之出现。散点图的价值在于展示关系,而不只是比较大小。今天做数据观察时,如果只看两个变量的均值,很容易忽略分布形态;把原始点画出来,异常值和聚集区就藏不住了。
图表工具的下一次跃迁来自计算机。1977年,约翰·图基出版《探索性数据分析》,主张先画图、再看数。他发明了箱线图,用五数概括(最小值、下四分位数、中位数、上四分位数、最大值)描述一组数据的分布。箱线图不显示每个点,但能快速比较多个组别。在质量控制、医学试验、社会调查里,它至今是标准配置。图基反复强调一句话:图表不是结论的装饰,而是发现问题的工具。
过去二十年,动态和交互成了新变量。2006年,汉斯·罗斯林在TED演讲中展示了一个气泡图动画,每个气泡代表一个国家,横轴是人均收入,纵轴是预期寿命,气泡大小是人口。动画沿着时间轴播放,观众看到的是走势的整体迁移。这种图表不再要求读者自己播放时间序列,而是把预测和回溯压缩成一段视觉叙事。不过,动态图表也有代价:当动画速度过快,观察者反而记不住具体数值。
回到日常工作中,选择图表类型其实在回答三个问题。第一,你要比较的是类别还是时间?类别用柱状图,时间用折线图。第二,你要展示的是分布还是关系?分布用直方图或箱线图,关系用散点图。第三,你要传达的是精确数值还是整体趋势?精确数值用表格,整体趋势用图。一个常见的错误是:用饼图展示超过六个类别,或者用折线图连接本来无序的类别。图表选错,数据再准也会误导判断。
统计图表小史给今天的启示并不复杂。每一张经典图表的背后,都有一个具体到不能再具体的问题:霍乱从哪来、贸易差额怎么变、客流何时高峰、身高如何遗传。图表形式是答案,问题才是起点。做数据观察时,不妨先问自己:我想让读者看到什么?如果答案清晰,图表的形状往往已经确定了。