数据整理入门:从一张乱表到可读趋势
很多人第一次拿到数据时的反应是直接画图。结果图出来了,横轴挤成一团,纵轴忽高忽低,看不出任何走势。问题往往不在分析方法,而在整理这一步。整理不是把数据变干净就完事,它的目标是让走势能被看见、被比较、被追问。
先看一个常见场景。某门店导出一份销售表,日期字段写着“2024/3/5 14:32:07”,商品字段混着“苹果-5斤”“苹果 5kg”“红富士苹果”。直接统计,苹果会被拆成三个品类。做法是先拆字段:日期拆成年、月、日、时四列,商品拆成品类、规格、单位三列。拆完之后,同一品类的数据才能合并。这一步花的时间通常占整个整理流程的一半以上,但省不掉。
字段拆完,接着处理缺失值。一份3000行的用户行为表,如果“年龄”列缺了400行,直接删掉会损失13%的样本;全部填0,又会把0岁这种明显异常值带进均值。更稳妥的做法是分情况:缺失比例低于5%,可以剔除;5%到20%之间,用中位数或众数填补,并新增一列标记“是否填补”;超过20%,这列就不适合作为主要观察指标,只能放在备注里。
单位不统一是另一个高频问题。同一份报表里,金额有的写“元”,有的写“万元”;距离有的用公里,有的用米。如果不先统一,算出来的总和可能差出一万倍。一个简单的检查方法:对每个数值列算最大值和最小值,如果最大值除以最小值超过1000,大概率存在单位混用。统一之后再算均值、中位数,走势才有可比性。
整理到这一步,可以开始看走势了。但看走势不等于预测。把过去12个月的订单量按月排列,画出折线,先看三件事:有没有明显的季节波动,有没有突然的跳变,跳变之后是回落还是维持。比如某品类在7月突然从日均200单涨到800单,持续了5天又回到220单,这更像一次促销活动,而不是趋势变化。把它当成趋势去预测下个季度,就会偏得很远。
预测之前,至少需要两个完整周期的数据。月度数据要24个月,周度数据要104周。周期不够,任何模型给出的结果都只能当作参考。更实际的做法是先把观察做扎实:记录每次异常波动的时间点、持续天数、前后差值,积累三到五次之后,再回头判断它是偶发还是规律。这个记录过程本身就是整理的一部分。
最后提一个容易被忽略的细节:整理完的数据要留版本。原始表不动,另存一份清洗表,再另存一份分析表。每次修改记一行日志,写清楚改了什么、为什么改。三个月后回头查一个数字,能顺着日志找到源头,比重新整理一遍省事得多。数据整理没有一步到位的办法,但每一步都留下痕迹,后面的观察和判断才有依据。