样本变了,总体还能代表吗?
年初看一份消费报告,2023年某品类线上销量同比增长18%,结论是“消费复苏强劲”。但翻到附录:样本来自某电商平台,而该平台当年新增了大量下沉市场用户。换句话说,增长可能只是“进店的人变了”,不是“原来的人买得更多”。这就是样本与总体关系最朴素的提醒——你看到的走势,取决于谁被装进了样本框。
统计学的教科书会告诉你,样本要随机、要独立、要有代表性。但真实世界里,样本框从来不是天上掉下来的。它由谁有资格被记录、谁愿意被记录、谁的数据能被采集到共同决定。2022年某城市做就业调查,电话抽样覆盖了固定电话用户,结果60岁以上样本占比超过四成,而实际劳动年龄人口中这部分比例不到两成。样本框偏了,后面无论怎么加权,都是在偏的底子上修修补补。
一个容易被忽略的事实是:总体本身也在变。国家统计局每年调整城乡划分标准,2023年常住人口城镇化率66.2%,但若按新口径回溯,2010年的数字也会跟着变。这意味着“与去年同比”这个动作,有时候比的是两个不同总体。做趋势观察时,如果只盯着增长率,不看分母有没有换过定义,很容易把口径调整误读成真实波动。
样本与总体的错位,在互联网数据里更隐蔽。某短视频平台2024年一季度创作者日均发布量环比下降7%,但同期新注册创作者增长了22%。如果总体定义为“所有注册创作者”,那人均发布量其实降得更狠;如果总体只算“活跃创作者”,下降幅度可能只有3%。同一个平台,选哪个总体,得出的结论可以差出一倍。做数据观察时,先问一句“分母是谁”,往往比看分子更有用。
再看一个预测失效的案例。2021年多家机构预测2022年国内新能源车销量增速会放缓,依据是当时样本城市的上险量增速已从三位数降到40%左右。但样本城市主要是限牌限购的一二线城市,而2022年真正的增量来自三四线城市和县域市场。样本没有覆盖到增长发生的地方,预测自然偏了。这不是模型的问题,是样本框没有跟上总体结构的变化。
那怎么办?不是要放弃样本,而是要养成“样本体检”的习惯。第一,定期核对样本框与总体的关键结构变量,比如年龄、地域、行业分布,偏差超过5个百分点就值得警惕。第二,对历史数据做断点检测,如果某个月份走势突然跳变,先查口径有没有调整,再找业务原因。第三,在预测时留出“结构变化”的假设空间——不要默认总体分布不变。
回到开头的消费报告。如果作者多写一句“样本平台新增用户中下沉市场占比从12%升至31%”,读者对那个18%的理解会完全不同。数据本身没有变,变的是我们对它代表谁的判断。样本与总体的关系,说到底是一个关于“在说谁”的问题。做趋势观察,先把“谁”说清楚,再谈“涨了还是跌了”。