数据新闻入门:从数字里读出趋势
很多人对数据新闻的第一印象是图表:折线图、柱状图、地图。但图表只是最后一步。真正的工作从找数据开始。比如想了解某城市地铁客流变化,可以去找当地交通部门每年公布的统计公报,里面通常有分线路、分月份的客运量。把这些数字录入表格,先看总量,再看分月走势。2020年2月很多城市地铁客流跌到常年同期的两成左右,这不是新闻,但如果你对比不同城市恢复速度,就能看出产业结构差异——旅游城市恢复慢,制造业城市恢复快。
拿到数据后,第一件事不是画图,而是清理。公开数据常有问题:单位不统一、月份缺失、口径变化。某省统计年鉴里,2018年之前“规模以上工业企业”的统计门槛是年主营业务收入2000万元,之后调整为2000万元并保持不变,但更早年份有过500万元的标准。如果不注意这个变化,直接把十年数据连成一条线,就会误读走势。清理的笨办法是逐列检查:量纲、缺失值、异常点。异常点不一定错,可能正是值得写的信号,但需要先标记出来,单独核实。
清理完就可以做比较。比较是数据新闻的核心动作。单一数字没有意义,只有放在时间序列或空间序列里才有信息。比如某地公布去年新增就业人数8.2万人,这个数字大还是小?要看前三年均值、看全省排名、看产业结构。更进一步,可以把新增就业和当地GDP增速放在一张图里,观察两者是否同步。如果某年GDP增速放缓但就业增加,可能说明服务业占比提升,或者灵活就业统计口径有变。这种观察不需要复杂模型,只需要把两条走势并排放,用眼睛找背离点。
说到预测,数据新闻里要格外小心。预测和趋势外推是两回事。趋势外推是“如果过去五年每年增长5%,明年可能还是5%左右”,这是描述性判断。预测则是“明年一定会增长5.3%”,这需要模型和假设。大部分数据新闻只做前者。比如根据过去十年某城市常住人口年均增加12万,推测未来五年可能增加60万左右,但必须加一句:这取决于产业政策、落户门槛和周边城市竞争。没有假设的预测是数字游戏。读者看到“预计”“有望”这类词,应该先找假设条件。
可视化也有讲究。同一组数据,用折线图看走势,用柱状图比大小,用散点图找相关。但相关不等于因果。有个经典例子:某段时间冰淇淋销量和溺水人数同时上升,两者高度相关,但原因不是冰淇淋导致溺水,而是夏天到了。数据新闻如果只呈现相关性,不追问机制,就容易误导。好的做法是,在图表旁边写清楚“这两个变量同步变化,但可能受第三因素影响”,或者直接去找更细粒度的数据来检验。
最后是写作。数据新闻的文本不是图表的说明书。图表已经展示了走势,文字应该解释为什么。比如图表显示某电商平台三线城市订单量两年翻倍,文字可以写:翻倍的主要是日用百货,客单价从45元降到38元,说明新增用户对价格更敏感。这样的观察来自对细分数据的拆解,而不是重复图表上的数字。一篇合格的数据新闻,读者看完应该记住一个具体的发现,而不是一堆百分比。
入门阶段,建议从自己熟悉的领域找数据。喜欢足球,可以统计某联赛过去十个赛季的升班马保级率;关心房价,可以整理某个小区近三年的成交记录。数据不必大,但口径要清楚,来源要可查。做完三五个小题目,自然会对数据清理、走势比较和预测边界有手感。数据新闻的门槛不在技术,而在耐心和诚实——耐心处理脏数据,诚实对待不确定性。