统计图表小史:从霍乱地图到折线图
1854年伦敦苏活区暴发霍乱,十天内死了五百多人。医生约翰·斯诺没急着写论文,他做了一件事:把每一例死亡病例的位置标在一张街区地图上。标完后,他观察到一个明显的聚集——死者几乎都围着宽街的一台水泵。这张地图后来被称为霍乱地图,它可能是统计图表史上最著名的一张。斯诺没有用复杂的统计模型,只是把数据放回它发生的位置,走势就自己浮出来了。
在斯诺之前,图表更多是几何游戏。1786年,苏格兰工程师威廉·普莱费尔发明了第一张真正意义上的折线图,用来展示英国进出口贸易的走势。他当时用的是手工绘制的坐标纸,横轴年份,纵轴金额,一条线把十几个点连起来。这张图让议会里的议员第一次能直观看到:贸易逆差不是某一年的事,而是持续了十几年。数据本身没变,但图形让预测有了依据。
折线图之后,饼图和柱状图也陆续出现。1801年,普莱费尔又出版了《统计摘要》一书,里面用了多种图形来展示人口、税收和贸易数据。有意思的是,他特别强调图形不能骗人:比例要准确,坐标轴不能随意截断。这个原则到今天依然成立。比如把纵轴从0截断到90,一条原本平缓的走势会变得像悬崖。很多误导性的预测图,问题就出在这个细节上。
十九世纪中叶,法国工程师查尔斯·约瑟夫·米纳德把统计图表推向了另一个方向。1869年,他画了一张拿破仑远征俄国的地图,用线条宽度表示军队人数,用颜色表示温度,用方向表示行军路线。从法国出发时四十二万人,到莫斯科时只剩十万,回程时线条细得几乎看不见。这张图把时间、空间、数量和走势叠在同一张纸上,后来的数据可视化教材几乎都会提到它。米纳德的方法说明,图表不只能展示单一数据,还能讲一个多变量的故事。
二十世纪,统计图表开始进入日常。1920年代,美国电话电报公司用折线图追踪电话通话量的走势,发现周末通话量明显低于工作日,于是调整了资费策略。1930年代,经济学界开始用图表来观察失业率和物价指数的关系,菲利普斯曲线就是那个时期的产物。图表从少数人的工具变成了管理者的日常语言。但问题也随之而来:当图表被大量使用,误读和滥用就不可避免。比如把相关关系直接当成因果关系,是那个时代就有的老毛病。
到了计算机时代,图表的生产成本几乎降为零。1977年,约翰·图基出版了《探索性数据分析》,提出先画图再建模的思路。他强调,拿到数据第一件事不是算均值,而是画散点图、直方图,用眼睛观察分布和异常值。这个建议在今天依然实用。很多数据分析的起点,就是一张简单的散点图——它能告诉你数据有没有离群点,走势是线性还是非线性,有没有明显的分组。
回头看这几张图,会发现一条隐约的线索:每一次图表的进步,都对应着观察方式的改变。斯诺把数据放回空间,普莱费尔把数据放回时间,米纳德把数据放回战争,图基把数据放回视觉。图表不是装饰,而是一种思考工具。它的价值不在于画得多漂亮,而在于帮你看到数字背后那个真实世界的形状。今天我们用代码画图,工具变了,但那个基本动作没变:把数据摆出来,然后看。
对做数据观察的人来说,这段小史至少留下两个提醒。第一,图表的类型要匹配数据本身的结构——时间序列用折线,构成用饼图或堆叠柱,分布用直方图或箱线图,错了就容易误导。第二,任何一张图都是一种简化,简化就有取舍。做预测时,最好把原始数据和图表放在一起看,别只看那条平滑的线。走势是观察的结果,不是观察的替代。