数据来源辨别:一份观察笔记
做趋势观察,最怕的不是没数据,而是拿到一份来路不明的数据就动手画图。去年某平台发布过一份“全国主要城市租金走势”,看起来曲线平滑、结论清晰。后来有人翻出原始表格,发现样本只有12个小区,且集中在三个城区,所谓“全国”是标题的修辞。这份数据本身不假,但用它做预测,误差可能比随机猜测还大。辨别数据来源,第一步不是看数字,而是看它怎么来的。
常见的数据来源大致分三类:一手采集、二手转载、三手拼凑。一手采集有明确的调查方案和原始记录,比如国家统计局每月发布的居民消费价格指数,会注明调查范围、样本量和权数。二手转载往往丢失口径,比如某研究机构引用央行数据,却把“金融机构贷款余额”简写成“贷款数据”,一字之差,含义从存量变成流量。三手拼凑更隐蔽,把不同年份、不同地区的数字放进同一张表,再算一个增长率。遇到这类材料,先找原始出处,找不到就降权使用。
时间戳是辨别数据来源的第二个抓手。同一指标,月度数据和季度数据讲的可能是两件事。以某款移动应用的活跃用户数为例,第三方监测机构给出的是“月活跃”,公司财报披露的是“日活跃”,两者相差三到五倍。如果只看数字大小,很容易得出“数据打架”的结论;核对时间口径后,才发现是统计周期不同。观察走势时,把时间戳对齐,比争论谁对谁错更有意义。预测模型里如果混入不同频率的数据,结果往往在拐点处失真。
缺失值的处理方式,也能暴露数据来源的成色。一份完整的年度数据,如果中间某个月突然空白,而前后走势又异常平滑,大概率是插值补上的。插值本身不是问题,问题是补值不标注。某市曾公布过一份空气质量数据,连续七天PM2.5浓度完全一致,后来解释说是设备维护期间沿用了前一日数值。这种“沉默的缺失”对预测的干扰,比明显的空白更大。拿到数据后,先数一数非空记录的比例,低于八成就要谨慎。
交叉验证是辨别来源的笨办法,也是有效的办法。同一个现象,至少找两个独立来源比对。比如观察某类商品的线上销量,平台自己公布的数据和物流公司的揽收数据可以互相参照。两者走势大体一致,说明来源可信;如果平台数据逐月上升,物流数据却持平,就要追问差异在哪。2023年有一组关于“县域咖啡消费”的数据,社交平台热度很高,但实地走访的样本只有二十几家门店。后来另一家机构用外卖订单数据复核,发现增长主要集中在少数旅游城市。交叉验证不一定能给出正确答案,但能排除明显有问题的来源。
对预测而言,数据来源的辨别不是一次性的工作。同一份数据,在样本内和样本外表现可能完全不同。某量化团队曾用历史数据回测一个消费指标,拟合度很高,但换到新一期的数据上,误差突然放大。查下来,原来是原始数据在某个时间点调整了统计口径,旧口径和新口径之间没有换算说明。预测的前提是数据生成过程稳定,如果来源本身在变,再精巧的模型也难校准。观察这类变化,比盯住单期数字更有价值。
回到日常操作,可以养一个习惯:每引用一份数据,在备注里写清三件事——谁采集的、什么时候、覆盖什么范围。写不清楚的,在图表里用虚线或浅色标出,提醒自己这是低置信度材料。数据来源的辨别没有一劳永逸的方法,但每一次追问出处,都会让观察更接近事实,让预测少一点盲目。