样本与总体:从三次数据偏差说起
做数据观察久了,会发现一个反复出现的错觉:手里的样本看起来足够大,结论却总跟实际对不上。去年接触过一个电商退货率的案例。某品类月订单约12万单,平台后台显示的退货率稳定在8%左右。但把线下门店自提的订单单独拉出来,退货率只有3.1%。差别不在商品,而在样本:后台默认统计的是快递签收后的退货行为,自提用户当场验货,不满意直接不取,这部分根本没进入退货流程。总体是12万单,样本却漏掉了自提那2.3万单,偏差就是这么来的。
覆盖偏差是最容易被忽略的一类。它不体现在数字大小上,而是藏在“谁没被统计到”里。2022年某城市做过一次通勤调查,样本量1.8万份,结论是平均单程通勤时间34分钟。听起来合理。但调查通过手机App推送,而该App的主要用户是地铁乘客。自驾和骑行群体几乎被排除在外。后来补充了路口摄像头数据和公交刷卡数据交叉验证,实际平均通勤时间接近41分钟。样本本身没有造假,问题出在抽样框只覆盖了总体的一部分。做趋势解读时,如果只看单一来源的数据,很容易把局部走势当成全局走势。
另一类偏差跟时间窗口有关。某消费品牌每季度做用户满意度调研,连续六个季度得分都在82到85分之间,看起来相当稳定。但把复购数据拉出来对比,同一批用户中,三个月内复购的比例从41%降到了29%。满意度没跌,行为已经变了。原因在于调研样本是季度末随机抽取的活跃用户,而流失用户已经不在样本池里了。用这种数据做预测,会得出“用户基本盘稳固”的结论,跟实际经营情况差得很远。样本的稳定性有时候恰恰掩盖了总体的结构性变化。
响应偏差也值得单独说。某在线问卷平台统计过一组数据:同一份关于“每周运动频率”的调查,主动点击链接填写的用户中,有67%报告每周运动3次以上。而通过电话随机访问同一城市居民,这个比例只有38%。两个样本的总体定义相同,结果差了近一倍。原因不复杂:关心运动的人更愿意点开运动相关的问卷。这种偏差没有覆盖问题那么直观,但影响同样大。观察数据时,看到异常高的比例,先别急着下结论,想想谁更可能出现在这个样本里。
这几个案例有个共同点:样本量都不小,偏差却跟样本量没关系。1.8万份通勤调查、六个季度的满意度数据,规模上足够,错在结构。很多人习惯用样本量来评估数据可信度,但样本量解决的是随机误差,解决不了系统性偏差。一个覆盖有偏的样本,量再大也只是把错误放大。做数据观察时,先问样本怎么来的,比问样本有多少更重要。
那实际操作中怎么减少这类问题?几个经验。第一,把样本来源写清楚,不是写“随机抽取”,而是写清楚抽样框是什么、排除了谁。第二,尽量找两组独立数据交叉验证。比如退货率,后台数据和客服工单数据对照看;通勤时间,App数据和刷卡数据对照看。两组数据如果走势一致,可信度就高一些;如果分歧明显,先别急着取平均,去查分歧本身。第三,对时间序列数据,留意样本构成有没有随季度变化。有些调研每期都换一批人,表面是同一份问卷,实际上总体已经变了。
样本和总体的关系,说到底是一个映射问题。样本是总体的一个投影,投影角度偏了,形状就失真。做趋势解读和预测时,与其纠结模型选哪个,不如先花时间确认手里的数据到底映的是谁。这个环节没有捷径,只能一个案例一个案例去核对。核对多了,对数据的判断会变得具体,而不是停留在“样本量够大就行”的层面。