看数据前,先收下这7条统计常识
看一份数据报告,最容易犯的错是直接读结论,跳过口径。举个常见的例子:某城市公布平均通勤时间35分钟。这个数可能来自地铁刷卡样本,也可能来自手机信令,两者覆盖的人群不一样。地铁样本天然排除了开车和骑车的人,算出来的均值会偏低。拿到一个数,先问三件事:谁被统计了、统计的是哪个时间段、缺失值怎么处理。这三问答不上来,后面的走势和预测都悬。
均值是最常被误用的统计量。假设一个5人小组,月收入分别是4000、4500、5000、5500、41000元。均值算出来是12000元,但组里4个人都没到这条线。那个41000的极端值把整体拉高了。这时候中位数更贴近多数人的感受,它是5000元。看收入、房价、阅读时长这类右偏分布的数据,中位数往往比均值更有解释力。报告里只给均值不给中位数,值得多留个心眼。
百分比要盯基数。某地去年新增企业100家,今年新增150家,增幅50%,听起来不错。但去年基数只有100,今年多出的50家可能来自一次集中的注册便利化改革。另一个城市从10000家增到10500家,增幅5%,绝对增量却是500家。只看百分比,会高估小基数的变化,低估大基数的体量。做观察时,把百分比和绝对数并排放在一起看,很多虚高的走势会立刻现形。
相关不等于因果,这句话被说滥了,但具体场景里还是容易忘。有数据说,冰淇淋销量和溺水人数同步上升,两者确实相关,但推不出冰淇淋导致溺水。共同原因是气温升高。再比如,某公司发现加班时长和项目产出正相关,就鼓励加班。真实情况可能是:只有重要项目才会安排加班,项目本身资源多、关注度高,产出自然高。判断因果,得看有没有随机对照,或者至少控制住主要混杂变量。没有这层设计,相关只能当线索,不能当结论。
抽样方式决定数据能代表谁。1936年美国大选,一家杂志用电话和汽车登记名单做调查,样本量很大,却预测错了。原因是当时装电话、有汽车的人偏富裕,和全体选民结构差得远。今天做用户调研也一样:只发线上问卷,会漏掉不常上网的群体;只统计App内行为,会忽略卸载用户。样本量再大,也补不上覆盖偏差。看到一份调查,先看它从哪里抽人,比看它抽了多少人更关键。
看走势时,注意时间窗口的选择。同一组月度数据,取最近3个月,可能显示连续下滑;取最近12个月,可能只是正常波动。比如某品类销量,7月环比降8%,但同比只降1%,放在三年周期里几乎是一条平线。把窗口拉长,能过滤掉短期噪声;把窗口缩短,能更快捕捉拐点。两种做法没有绝对对错,取决于你想回答什么问题。怕的是只选对自己观点有利的那个窗口,那就不是观察,是挑选。
做预测时,留出误差范围比给一个点估计更有用。说下季度销量会到10万件,不如说落在9万到11万件之间的概率较高。预测依赖历史走势,但历史不会简单重复。政策调整、竞争对手动作、季节因素都会让实际值偏离。一个实用的习惯是:每次预测后记录实际值,算算自己平均偏了多少。偏得多了,就回去检查假设。预测的价值不在于一次说准,而在于持续校准。
最后一条:分清描述和推断。描述是「本月订单量环比下降5%」,推断是「因为用户流失了」。前者是数据里能直接读到的,后者需要额外证据。写观察笔记时,把这两类句子分开写,读者才知道哪些是事实,哪些是解释。数据、走势、预测三件事,前两件尽量靠近事实,第三件明确标注假设。这样做出来的图表笔记,不一定好看,但经得起回头看。