从霍乱地图到动态曲线:统计图表小史
1854年伦敦宽街霍乱暴发,医生约翰·斯诺把死亡病例逐一标在街区地图上,水泵周围的黑色短杠堆成密团,离水泵越远越稀疏。这张图不是装饰,而是一次推理:他让数据自己指出水源。当局拆掉水泵手柄后,病例数开始回落。斯诺的画法并不复杂,却把“观察”从表格里拽了出来,变成肉眼可辨的空间关系。统计图表的历史,差不多就是从这类具体麻烦里长出来的。
在斯诺之前,图表更多服务于天文和航海。1786年,苏格兰工程师威廉·普莱费尔发表第一张真正意义上的折线图,用来展示英格兰与法国的贸易差额。他把时间放在横轴,金额放在纵轴,一条线穿过十几个年度节点。这张图让“走势”第一次有了视觉形状:不看数字,也能看出哪几年顺差、哪几年逆差。折线图后来成为最通用的统计图形,原因不神秘——它把连续变化压缩成一条可比较的线,观察成本极低。
同一时期,柱状图和饼图也陆续出现。普莱费尔自己就画过饼图,用来表示土耳其帝国的亚洲、欧洲、非洲领土比例。但饼图有个老问题:人眼对角度差异不敏感。两个扇形相差5%,多数人看不出来,换成两根并排柱子,差异立刻可见。这解释了为什么商业报告里饼图用得越来越少,而条形图始终稳当。图形选择不是审美问题,是感知精度问题。
1858年,南丁格尔在克里米亚战争后画出著名的玫瑰图,用扇形面积表示每月死亡人数,并用颜色区分死因。她发现,非战斗死亡远超战死,主要原因是卫生条件恶劣。这张图递交给维多利亚女王和议员,直接推动了军队医院改革。南丁格尔的图在今天看来有争议:面积编码不如长度编码准确,容易夸大差异。但它完成了当时最重要的任务——让决策者在十秒内看懂一个他们不愿面对的事实。
二十世纪后半叶,统计图表进入两个新方向。一个是雅克·贝尔坦在1967年提出的图形符号学,试图用视觉变量(位置、长度、面积、颜色、方向)系统解释图表如何传递信息。另一个是计算机带来的动态更新。1977年,统计软件S开始普及,图表不再手绘,可以随数据实时重画。到了1990年代,金融终端把折线图刷新频率从每天一次推到每秒一次,“走势”从历史记录变成了实时流。这里的关键变化不是速度,而是观察者与数据的关系:从回看变成盯盘。
动态图表也带来新麻烦。2008年金融危机期间,不少风险模型用历史走势外推未来,结果在极端行情中失效。图表能展示相关性,却很难自动给出因果。一个经典例子是:冰淇淋销量与溺水人数同步上升,两条线几乎重合,但真正变量是气温。如果只看图不做分层,预测就会跑偏。统计图表小史里,这类教训反复出现——图形越流畅,越容易让人忘记它省略了什么。
今天,从公共卫生周报到商业仪表盘,统计图表已是默认语言。回看两百年,变的工具从铜版刻印到浏览器渲染,不变的是那条底线:图表把数据翻译成视觉判断,但翻译总有损耗。走势可以提示方向,预测需要额外假设,观察者最好知道图是怎么画的、少了哪一层。斯诺当年若只画一张汇总表,宽街的水泵可能还要多转几天。
对做数据方法的人来说,这段小史有个朴素提醒:先问要回答什么问题,再决定画什么图。比较大小用条形,看时间变化用折线,看分布用直方图或箱线图,看空间关系用地图。每换一种图形,都是在选择让读者看见什么、忽略什么。统计图表没有万能模板,只有具体场景下的合理取舍。