中盾观察
首页 / 趋势观察 / 正文

异常值怎么找:从三个生活场景说起

栏目:趋势观察 | 约1431字 | 2026-09-01

上个月帮朋友看一份门店销售表,某天营业额突然多了两个零。朋友第一反应是系统出错,查完发现是店长把一笔团购订单重复录入了。这种明显偏离日常范围的数据,就是异常值。它不一定代表错误,但一定值得停下来看一眼。在数据观察里,异常值往往是最先暴露问题的信号,也可能藏着被忽略的真实变化。

先看一个最直观的例子。假设某城市一周的共享单车日骑行量分别是:12万、11.8万、12.3万、11.9万、12.1万、11.7万、45万。最后那个45万就是异常值。你可以用箱线图快速识别:把数据从小到大排,找到中位数和四分位数,算出四分位距(IQR),超过上四分位加1.5倍IQR或低于下四分位减1.5倍IQR的点,通常标为异常。这个例子里,前六个值集中在11.7到12.3之间,IQR很小,45万远远跳出上界。方法简单,但对偏态分布的数据要谨慎,比如收入数据天生右偏,用IQR可能把高收入者全标成异常,这时候需要结合业务判断。

另一种常见方法是Z分数。它衡量一个数据点距离平均值有多少个标准差。比如某班级数学平均分75,标准差5,某学生考了95,Z分数就是4,意味着比平均高出4个标准差。按经验规则,Z分数绝对值大于3的点可以视为异常。但Z分数有个前提:数据大致服从正态分布。如果数据本身波动大、样本少,Z分数容易误判。举个例子,某只股票连续20天日涨跌幅的标准差是1.2%,某天涨了4.5%,Z分数约3.75,确实异常。但如果是新股上市首日,波动本身就大,这个Z分数就不那么可靠。所以用Z分数前,先看数据分布形态,再看样本量。

散点图适合看两个变量之间的关系。比如观察广告投入和销售额,大部分点沿着一条斜线分布,但有几个点明显偏离。其中一个点广告费很高,销售额却很低。这可能是投放渠道选错了,也可能是那段时间竞品降价。散点图的好处是,你能同时看到异常值在横轴和纵轴上的位置,判断它是单变量异常还是双变量关系异常。在实际分析中,我习惯先画散点图,再决定要不要用IQR或Z分数做量化筛选。图能提供上下文,数字只能给一个阈值。

识别出异常值之后,怎么处理?常见做法有三种:保留、修正、剔除。保留适用于异常值本身有业务含义的情况,比如某天销量暴增是因为上了本地新闻,这个点对后续预测反而重要。修正适用于明确知道是记录错误,比如小数点错位、单位写错,可以按规则改回来。剔除要最小心,因为删掉一个极端值,平均值和标准差都会变,走势可能被平滑掉。我一般会做两次分析:一次含异常值,一次不含,对比结论差异。如果差异很大,说明这个点影响关键判断,不能随便删。

还有一种情况是异常值成串出现。比如某电商平台连续三天退货率从2%跳到8%,单独看每天都不算极端,但连在一起就是异常模式。这时候用简单的阈值法会漏掉,需要看移动平均或累积偏差。方法上可以计算滚动Z分数,或者用时间序列的残差分析。核心思路是:异常不一定是单个点,也可能是一段走势的突变。观察连续异常比观察孤立异常更有价值,因为它往往指向系统性问题,而不是偶然误差。

最后提醒一句:异常值识别没有万能公式。IQR、Z分数、散点图都是工具,用哪个取决于数据分布、样本量和业务背景。新手容易犯两个错:一是看到异常就删,二是完全忽略异常。更稳妥的做法是,先标记、再追问、后决策。标记用统计方法,追问靠业务知识,决策看分析目标。如果目标是预测整体趋势,异常值可能需要特殊处理;如果目标是发现风险点,异常值恰恰是重点。把异常值当成线索而不是麻烦,数据观察会更有意思。