中盾观察
首页 / 趋势观察 / 正文

整理数据之前,先想清楚这三件事

栏目:趋势观察 | 约1248字 | 2026-10-07

不少人把数据整理理解为把表格拼在一起、格式调齐。真正动手才会发现,麻烦的不是操作,而是决定什么算一条记录。上个月帮一个做零售的朋友看门店流水,同一家店在系统里出现三种名字:带“店”字的、带“分店”的、还有全称。按名称直接汇总,门店数是47;按统一编码汇总,实际只有31家。16家的差额,全部来自命名不一致。整理的第一步,就是先确定唯一标识。

口径不统一,比缺失更麻烦。有份区域销售表里,华东包含六省一市,另一份报告里华东只算四省。两份数据各自都干净,合并之后总额差了8.3%。这种问题没法靠公式修正,只能回到源头,把每个字段的定义写下来。我习惯在表格最前面加一个“口径说明”页签,记录每个指标的统计范围、时间边界、单位。写下来之后,团队里关于数字的争论至少少了一半。这也是观察数据时最先要确认的事:你看到的数字,到底在描述什么。

缺失值的处理方式,直接改变结论。一个用户行为表有12万行,其中“最近一次访问时间”缺失率19%。如果直接删掉这些行,剩余样本会明显偏向活跃用户,平均访问间隔被拉短。如果填一个固定值,比如填0或者填当天,又会把沉默用户误判成活跃用户。比较稳妥的做法是分两层:先标记缺失,保留原始行;再根据分析目的决定是否纳入。做走势分析时,我把缺失单独列为一类,结果发现这批用户的后续留存比整体低14个百分点,这个信息比填一个数有价值得多。

异常值不要急着删。某电商的日订单量平时在3000到5000之间,有一天跳到2.1万。查下来是当天上线了一个促销活动,不是数据错误。反过来,另一份表里有个-800的订单量,查出来是退货冲正时符号写反了。同样是异常,一个要保留,一个要修正。判断标准不是偏离均值多少倍,而是它有没有对应的业务事实。没有事实支撑的极端值,先挂起,不要立刻剔除,因为剔除之后你可能再也看不到它。

字段类型和单位是另一个高频坑。见过一份表把“金额”存成文本,排序时100排在99前面。也见过时间字段混用“2024/1/5”和“2024-01-05”,导入后一半变成空值。还有单位问题:一份表里重量既有千克也有克,没标单位,汇总出来的总重差了1000倍。整理时我会做三件事:统一时间格式、统一数值类型、在每个数值字段名后面带上单位。看起来琐碎,但后面做任何预测或对比,都靠这一步兜底。

整理完的数据,最好做一次反向验证。拿几个已知的汇总数去对,比如月度总额、去重后的用户数、最大最小值。有一次整理完一份三年的销售表,总数对得上,但按年拆分后发现2022年只有11个月的数据。原因是源文件里有一个月被存成了单独的工作表,合并时漏掉了。这种错误在总量层面看不出来,只有拆开看走势才会暴露。反向验证不需要复杂工具,几个交叉求和就能发现大部分问题。

回到起点,数据整理的目标不是把表变好看,而是让后续的观察和判断有可靠的依据。口径清楚、缺失有标记、异常有记录、单位统一,这四件事做完,一份数据才算能用了。至于用什么工具,Excel、SQL还是脚本,反而没那么关键。工具决定效率,定义决定对错。