数据来源辨别:一个观察者的经验笔记
做数据观察久了,最怕的不是没数据,而是拿到一份看起来漂亮、实则经不起推敲的数据。我翻过自己过去三年的工作笔记,发现至少有17次因为来源问题推翻重来。这里把踩过的坑和后来总结的辨别方法记下来,供参考。
先说一个最常见的场景:引用某行业增速。去年我写消费趋势时,在一份券商研报里看到“社零同比增速8.7%”,顺手就用了。后来核对国家统计局原始数据,发现当月社零同比是7.6%,8.7%是两年平均增速。两个数字都没错,但含义不同。如果讨论短期波动,用7.6%更合适;如果看复苏节奏,两年平均也有意义。问题在于,我没在文中说明口径,读者自然会按常理理解。从那以后,我给自己定了一条:任何增速数据,先问三个问题——同比还是环比? nominal还是real? 是当期值还是累计值?
辨别来源的第一步,是找到数据的原始发布方。现在很多数据经过三四手转引,每一次转引都可能丢失关键注释。比如某平台公布“日活用户突破1.2亿”,这个数字在科技媒体上反复出现。但翻到该平台向监管提交的招股书,里面写的是“平均月活2.8亿,平均日活1.2亿,日活定义为当日至少登录一次”。而另一份行业报告引用时,把“登录一次”改成了“使用超过1分钟”。定义一变,数字的含金量就变了。我的习惯是:如果一条数据被超过两家非原始机构引用,就去找最初的财报、统计公报或白皮书。花15分钟,能省掉后面很多麻烦。
第二个方法是看更新频率和修订记录。有些数据是实时更新的,比如股票价格、天气;有些是月度、季度更新,比如CPI、GDP;还有些数据发布后会有修订。2022年某省GDP初值是4.2万亿,次年最终核实数调整为4.15万亿,差了500亿。如果写趋势分析时用了初值,而后续报告引用了修订值,就会出现前后矛盾。我现在会做一件事:在数据表里加一列“修订状态”,标注“初值/修订值/最终值”。这个习惯帮我避免了好几次预测偏差。
第三个经验是警惕“百分比陷阱”。当看到“增长200%”时,先算绝对值。某细分市场从100万涨到300万,增长200%,听起来很快,但绝对值只增加了200万。如果换成“从10亿涨到30亿”,同样是200%,量级完全不同。我在观察社区团购数据时,见过一份报告写“某平台订单量环比增长150%”,但没给基数。后来查到基数只有8万单,增长后是20万单。对于万亿级市场,这个数字几乎可以忽略。所以,看走势不能只看百分比,要把分子分母都摆出来。
第四个方法比较笨但有效:交叉验证。找两个独立来源,对比同一指标。比如判断某城市人口流动趋势,可以看运营商手机信令数据,也可以看地铁客运量、租房平台活跃度。如果三个来源都指向同一方向,可信度就高。如果只有一个来源异常,就要多问一句为什么。去年某机构发布“某行业人才需求同比上升40%”,我查了招聘平台岗位数、社保缴纳人数、行业薪酬报告,三项数据都只上升了5%-8%。后来发现那个40%是把兼职和实习岗位也算进去了。不是说不能算,而是要在文中说明口径。
最后一条,是关于预测的。数据来源辨别的终点,不是找到“真实”的数字,而是找到“适合当前问题”的数字。做短期预测,用高频、及时的数据;做长期趋势,用经过修订的、口径稳定的数据。我自己的做法是:建一个来源清单,分三级——一级是官方统计和原始财报,二级是行业协会和学术研究,三级是媒体和自媒体。写观察笔记时,优先用一级,二级做补充,三级只用来找线索,不直接引用。这个清单每季度更新一次,把失效的来源划掉。
以上这些方法,没有一条能保证100%不出错。但过去一年,我的数据引用错误率从每篇2.3处降到了0.4处。辨别来源是个手艺活,靠的是多查一步、多问一句。如果你也有类似的经验,欢迎一起交流。