中盾观察
首页 / 行业观察 / 正文

当样本开口说话:数据里的局部与整体

栏目:行业观察 | 约1374字 | 2026-09-17

做数据观察时,最容易犯的错误不是算错,而是把样本当成了全部。2023年某电商平台做了一次用户满意度调研,回收有效问卷约1.2万份,结果满意率78%。但同期平台的后台投诉率却上升了2.3个百分点。数据团队后来发现,这份问卷主要通过App弹窗推送——那些已经卸载App的用户,根本看不到问卷。样本框里天然排除了最不满意的那批人。78%这个数字没有造假,它只是回答了一个不同的问题。

样本与总体的关系,本质上是“你看到的”和“实际存在的”之间的距离。这个距离有时很小,有时大到能让结论完全翻转。1936年美国总统选举,《文学文摘》杂志寄出1000万份问卷,回收约240万份,预测兰登将以57%对43%击败罗斯福。同一时期,盖洛普只用了约5万份样本,却预测罗斯福获胜。结果罗斯福拿下523张选举人票。《文学文摘》的样本量是盖洛普的48倍,输在了样本来源——它的名单来自电话簿和汽车注册记录,在1936年的美国,拥有电话和汽车的人偏向富裕阶层,与整体选民结构偏差很大。

这种偏差在今天的数据工作里依然常见,只是换了面孔。比如观察某款SaaS产品的用户活跃走势,后台日活从年初的12万涨到18万,曲线很好看。但如果把“日活”的定义从“打开即算”换成“完成一次核心操作”,数字可能从18万掉到7万。前者是样本,后者更接近总体吗?也不一定。关键在于你定义的口径是否覆盖了业务真正关心的那部分行为。口径一变,走势就变,预测也跟着变。

有一种更隐蔽的情况:样本本身没问题,但分组之后关系反转。这就是辛普森悖论。某招聘平台2022年公布过一组内部数据:整体看,女性程序员的平均面试通过率是31%,男性是34%,差距3个百分点。但按技术栈分组——前端、后端、算法、数据——每一组的女性通过率都比男性高1到2个百分点。整体差距来自分布:女性候选人更多集中在前端岗位,而前端岗位的通过率整体低于算法岗。当分组变量与结果变量纠缠在一起,合并数据会给出误导性的对比。

对做趋势判断的人来说,处理样本与总体的关系,第一步不是建模,而是问三个问题:样本怎么来的?覆盖了谁?漏掉了谁?第二步是拆。把总体按关键维度切开,看每个子样本的走势是否一致。如果一致,结论相对稳;如果不一致,那个“整体结论”就值得警惕。第三步是交叉验证。用另一个来源的数据做对照,哪怕样本量小一些。两个独立样本指向同一方向,比一个大样本的单一结论更可信。

预测之所以难,往往不是因为模型不够复杂,而是因为训练样本所处的环境已经变了。2020年之前,很多线下零售的客流预测模型表现不错,误差在5%以内。疫情之后,同样的模型误差跳到20%以上。模型没变,数据分布变了——样本还在,总体已经换了。这时候继续用旧样本做预测,等于用昨天的地图找今天的路。

回到开头的满意度调研。后来那个团队补了一轮电话回访,专门找过去90天内有过投诉记录的用户,样本量只有800份,但满意率只有41%。两个数字放在一起,78%和41%,才构成一个更完整的观察。样本不会说谎,但它只说自己知道的那部分。做数据的人,职责就是不断追问:还有谁没说话。

这不是一个能一次性解决的问题。总体在变,样本的覆盖能力也在变。每过一段时间,重新审视一次抽样方式、口径定义和分组逻辑,比追求更大的样本量更实际。毕竟,一个有偏差的大样本,不如一个诚实的、知道边界在哪的小样本。