中盾观察
首页 / 趋势观察 / 正文

同一组数据,两个结论:来源辨别的三个对比

栏目:趋势观察 | 约1445字 | 2026-09-16

去年底做消费复苏的选题时,我同时打开两个页面。一个显示某城市餐饮收入同比增长18%,另一个说同一指标只涨了3%。两个页面都挂着「数据」二字,都来自公开渠道。差别不在数字本身,而在数字是怎么被收上来的。这件事之后,我养成了一个习惯:看到任何一组数据,先问它是谁、从哪里、按什么口径拿到的。

最直观的对比发生在官方统计和平台数据之间。国家统计局的社会消费品零售总额,2023年全年约47.1万亿元,同比增7.2%。它是限额以上单位逐级上报、再经抽样推算的结果,覆盖口径大、周期固定,但发布有滞后,月度数据通常次月中旬才出。平台数据则是另一回事。某电商平台2023年「双11」期间说,户外运动品类成交额同比涨了约45%。这个数字真实,但它只代表在这个平台、这个时间段、这个品类里的走势。把它当成整个户外市场的增速,就会偏。两者不是谁对谁错,而是各自框住了不同的范围。

更隐蔽的差别在第三方爬虫和机构调研之间。2023年有段时间,几份报告都在说青年失业率。官方口径在当年6月是21.3%,之后暂停发布,改用新口径。同期某招聘平台用自己的岗位数据算出一个约14%的数字,另一家机构按问卷调研又给出接近25%的结果。三个数差了一倍。原因不复杂:招聘平台只统计自己站内的活跃岗位和投递行为,样本偏向互联网和城市白领;问卷调研则受回收率和提问方式影响,问「是否在找工作」和问「是否已就业」,得到的答案完全不同。做趋势观察时,如果只抓一个数,很容易把样本偏差误读成市场变化。

对比分析的核心动作,是核对三个东西:时间窗口、统计单位、覆盖范围。时间窗口上,月度数据有季节波动,春节在1月还是2月,会让1—2月的同比数字差出好几个百分点。统计单位上,「企业数」和「企业法人单位数」不是一回事,后者不含个体工商户,2023年全国个体工商户超过1.2亿户,漏掉这一块,判断就业和营收结构就会偏。覆盖范围上,同样是「新能源汽车销量」,中汽协的数据含出口,乘联会的数据分狭义和广义,口径不同,月度差值可以到十几万辆。

一个可操作的辨别方法是交叉验证。拿同一指标找至少两个独立来源,对比它们的走势是否同向。如果官方数据说增速在放缓,平台数据也说在放缓,只是幅度不同,那趋势判断可以成立。如果一边说涨、一边说跌,先别急着下结论,回去看口径。2023年旅游数据就是例子:文旅部按国内出游人次算,全年48.9亿人次;某出行平台按订单量算,恢复率只有2019年的七成左右。前者含短途和一日游,后者偏跨城长线,两者并不矛盾,但拼在一起才能看清「人出门了,但花得少、走得近」这个走势。

来源辨别还有一层:注意数据是谁发布的、有没有利益相关。平台发布自家品类增速,往往选高增长的口径;机构发布行业报告,有时会突出对自己有利的区间。这不是说数据造假,而是说选择本身带着立场。观察时把发布方、样本来源、计算方式三样写在旁边,比只记一个数字有用得多。我自己的笔记里,每个关键数据后面都跟着三行小字:来源、口径、更新时间。时间久了,回头翻,哪些结论站得住、哪些当时就被口径带偏了,一目了然。

做预测的人常犯的错,是拿一个来源的数去推另一个来源的走势。官方数据滞后,就拿平台数据补;平台数据偏窄,就拿调研数据补。补可以,但要清楚补的是什么。比较稳妥的做法是,把不同来源当作互相校验的刻度尺,而不是互相替代的答案。同一件事,三个来源给出三个数,先别选那个最顺眼的,先看哪个口径最接近你要回答的问题。数据来源辨别,说到底不是找「真数据」,而是找「对口径的数据」。