样本与总体:一份实用清单
做数据观察的人,迟早会撞上同一个问题:手里这批样本,到底能不能代表想说的那个总体。2023年某消费品牌想了解用户满意度,在官方社群发了问卷,回收两千份,好评率92%。同一年第三方机构随机抽了八百人,好评率只有67%。差出25个百分点,不是用户变了,是样本换了一批人。社群里的活跃用户天然更认可品牌,这个总体从一开始就被筛过一遍。
清单第一条:先写清楚总体是什么。不是“所有用户”,而是“2024年1月至6月、在华东地区、至少下过两单的用户”。边界越模糊,样本越容易偷偷替换总体。某外卖平台曾用“注册用户”做总体,结果样本里大量账号注册后从未下单,算出来的月均消费被严重拉低。换成“月活跃下单用户”后,数字立刻回到合理区间。总体定义改一句话,结论可能翻一倍。
第二条:检查抽样框有没有漏掉人。抽样框是实际能抽到的那份名单。电话调查的抽样框是电话簿,会漏掉只用网络电话的人;线上问卷的抽样框是能触达的账号,会漏掉已经卸载应用的人。盖洛普1936年预测美国总统选举,样本量240万,却输给了只抽5万人的民调。原因是它主要从电话和汽车登记名单里抽,1936年拥有电话和汽车的人偏向共和党,而实际投票的总体里,低收入群体大量缺席。样本大不等于样本对。
第三条:看回收率,不只看回收量。发出1万份问卷,收回3000份,回收率30%。剩下7000人为什么没回?如果恰好是满意度低的人更懒得填,这3000份的走势就会系统性偏高。有研究对比过,同一批用户里,主动填答者的平均满意度比被动受访者高0.4到0.6分(5分制)。回收率低于40%时,这个偏差足以改变结论方向。
第四条:区分随机误差和系统偏差。随机误差像抛硬币,样本量越大越收敛,公式也简单,1000份样本的误差大约在正负3个百分点。系统偏差不随样本量缩小,240万人的样本照样可以错得离谱。判断方法很土但有用:换一个完全不同的渠道再抽一次。如果两次结果差得远,先怀疑偏差,别急着下结论。
第五条:做预测时,把样本的走势和总体的结构放在一起看。某短视频平台用日活用户样本预测广告点击率,样本里一线城市占比38%,而总体里一线城市只占19%。按样本算出来的点击率偏高1.7个百分点。修正方法不复杂:给不同层加权,让样本的城市分布对齐总体。加权后误差从1.7降到0.3个百分点。权重不是造假,是把被扭曲的结构扳回来。
第六条:留一个对照。任何基于样本的观察,都该配一个独立来源做参照。内部问卷说留存率85%,就去看后台日志算出来的次月留存;社群投票说某功能最受欢迎,就去看功能使用埋点的数据。两个来源打架,先别选边,去查两边的抽样方式差在哪。多数时候,差异本身就藏着最有价值的信息。
这份清单不保证结论正确,它只做一件事:让你在说“根据样本”之前,先问自己六个问题。总体写清楚了吗?抽样框漏人了吗?回收率够吗?是随机误差还是系统偏差?样本结构和总体对齐了吗?有没有第二个来源对照?六个问题过一遍,能挡掉大部分低级错误。剩下的,交给更多数据。