样本与总体:那些被数据带偏的常见判断
做数据观察的人,迟早会碰到一个尴尬:手头明明有几百条记录、几千行报表,算出来的结论却和实际情况对不上。问题往往不在计算,而在样本和总体之间的关系被默认成了理所当然。
第一个常见问题是样本来源本身就有偏。某电商平台想了解用户对配送速度的满意度,把问卷挂在App首页。三天回收了四千多份,满意度高达91%。但稍微想一下就知道,愿意点开问卷的人,本身就是经常打开App、对平台有粘性的用户。那些因为配送太慢已经卸载App的人,根本不会出现在这个样本里。四千份数据,描述的不是平台用户这个总体,而是“还愿意用App的人”这个子集。类似的场景在行业观察里很常见:在写字楼里做通勤调研,得到的结果自然偏向白领;在高校门口做消费调查,样本天然偏年轻。样本怎么来的,比样本有多少更重要。
第二个问题是样本量不足,却急着对总体下结论。一个只有二十人的部门,想了解员工对新的打卡制度的看法,随机问了五个人,三个人说反对。这个比例被直接写进报告,变成“60%员工反对”。五个人里多一个或少一个,比例就上下浮动20个百分点。样本量小的时候,任何一个个体的态度变化都会被放大成趋势。统计上有个粗略的经验:要估计一个比例,误差控制在正负5%以内,至少需要几百个有效样本;如果要分城市、分年龄段看,还得再翻几倍。小样本不是不能用,但最好只当作线索,而不是当作结论。
第三个问题更隐蔽:把某一时点的样本,当成长期总体。某连锁餐饮品牌在三月做了一轮顾客调研,发现午市套餐的满意度比晚市高出一截,于是决定把午市菜单的配置推广到全天。但三月的午市顾客以周边上班族为主,晚市则以家庭客为主,两个时段面对的本来就是不同的人群。用午市样本去预测晚市总体,忽略了两者在消费场景上的结构性差异。数据观察里,时间维度常常被压扁成一个截面,而走势本身可能比单点数值更有信息量。
第四个问题是把样本中的相关关系,直接当成总体中的因果关系。某城市统计发现,冰淇淋销量高的月份,溺水事故也多。如果只看这两个变量的数据,很容易得出“吃冰淇淋导致溺水”的荒唐结论。真正的原因是气温:天热了,买冰淇淋的人多,游泳的人也多。样本里两个变量同步变动,背后可能有第三个变量在同时推动。做预测时,如果不把这类共同因素拆开,模型在样本内拟合得再好,到了总体里也会失效。
还有一种情况值得单独说:样本没变,总体变了。某招聘平台连续三年用同一套问卷调研求职者期望薪资,前两年结果稳定,第三年突然跳涨。乍看像是求职者心态变了,但细看样本结构,第三年新增的用户里,来自一线城市的比例明显提高。样本的构成变了,均值的走势自然跟着变。这类问题在追踪数据里尤其常见,如果不固定样本的构成,横跨时间的比较就要打折扣。
这些问题的共同点,是把样本当成总体的缩小版。实际上,样本和总体之间隔着抽样方式、样本量、时间变化和结构差异几道关。每过一道关,结论的适用范围就窄一分。比较稳妥的做法是:先问样本是怎么来的,再问样本够不够支撑当前颗粒度的结论,最后问这个结论放到总体里还成不成立。数据观察的价值不在于给出一个精确的数字,而在于说清楚这个数字能覆盖到哪里、不能覆盖到哪里。
说到底,样本是观察总体的一个窗口,不是总体本身。窗口开在哪个位置、开多大、什么时间开的,都会影响看到的东西。承认这层关系,比追求一个漂亮的百分比更接近事实。