中盾观察
首页 / 数据方法 / 正文

预测模型入门:两种思路的对比

栏目:数据方法 | 约1227字 | 2026-09-19

做数据观察时,常会遇到一类问题:下个月的销售额大概是多少?明天的地铁客流量会不会涨?这类问题背后,其实是在找一个可用的预测模型。入门阶段最容易混淆的,是把两种不同思路当成同一种东西:一种靠近期数据平滑外推,另一种靠变量之间的关系拟合。两者都能给出数字,但适用场景差别不小。

先看第一种,移动平均。假设某便利店过去5天的矿泉水销量分别是42、38、45、40、44瓶。取5日移动平均,得到(42+38+45+40+44)/5=41.8,于是把41.8当作第6天的预测值。这个方法简单,对短期走势的跟随比较稳。但它有个明显短板:如果销量正在持续上升,比如从38一路涨到50,移动平均会一直落后于实际值,因为它把新旧数据同等对待。指数平滑稍微改进了一点,给近期数据更高权重,但本质上还是只看历史序列自身。

第二种思路是线性回归。同样预测矿泉水销量,这次不只看销量本身,还引入一个解释变量:当天最高气温。收集30天的数据,以气温为横轴、销量为纵轴,画散点图,可能看到气温每升高1摄氏度,销量平均增加2.3瓶。用最小二乘法拟合出一条直线,就可以根据明天的气温预报来算预测值。这种方法的价值在于,它试图解释“为什么涨跌”,而不仅是“过去怎么走”。代价是需要额外数据,且假设变量之间的关系稳定。

把两种方法放在同一组数据上对比,差异会更直观。假设真实走势是:气温从20度升到30度,销量从35瓶升到58瓶。移动平均给出的预测会缓慢爬升,始终比真实值低3到5瓶;线性回归则能跟上趋势,误差控制在1到2瓶。但如果气温骤降、销量意外下滑,线性回归会严重高估,因为它默认气温和销量的关系不变。移动平均反而更抗突变。这就是预测中常见的权衡:拟合能力强的模型,对异常值更敏感。

入门时还有一个容易被忽略的点:预测周期越长,两种方法的差距越大。移动平均本质上假设未来和最近一段时间差不多,适合1到3天的短期判断。线性回归如果外推太远,比如用20到30度的数据去预测40度时的销量,很可能失真,因为现实中的关系未必是线性的。做数据观察时,不妨把预测结果和实际值一起记录,每周算一次平均绝对误差。误差稳定在什么范围,比单次预测准不准更有参考价值。

从工具选择上看,入门阶段不必急着上复杂模型。如果只有一串时间序列数据,没有额外的解释变量,指数平滑或ARIMA的简化版就够用。如果有多个可能影响走势的因素,比如价格、气温、节假日,可以先从多元线性回归入手。关键不是模型多高级,而是清楚它背后的假设。一个只靠历史均值的预测,和一个假设变量关系不变的预测,失效的条件完全不同。

最后提一个练习建议:找一份自己熟悉的数据,比如小区快递柜的每日取件量,或者常读公众号的阅读数。用前20天做训练,后10天做测试,分别跑一遍移动平均和简单回归。对比两种预测的误差,再回头想:哪种方法更贴合这条走势的生成逻辑?这样的对比做上三五次,对预测模型的理解会比读十篇教程更实在。数据不会说谎,但解读数据的方法需要反复校准。