中盾观察
首页 / 趋势观察 / 正文

回归与相关:两把尺子量趋势

栏目:趋势观察 | 约1297字 | 2026-09-24

两年前我整理过一份城市充电桩的季度数据。有人看到“充电桩数量”和“新能源车保有量”两条线几乎同步上扬,就说“桩多了,车才卖得好”。这个判断跳过了中间环节,也混淆了两个工具:相关看的是同步程度,回归看的是平均影响。把它们混着用,解读就容易走偏。

相关回答的是“一起动吗”。用皮尔逊系数衡量,取值在-1到1之间。2023年国内某新一线城市,充电桩密度与新能源车渗透率的相关系数约0.82,属于强正相关。但强相关不等于因果,也不等于可以拿一个数去推算另一个数。比如“雪糕销量”和“溺水人数”在夏季的相关系数能到0.7以上,背后是气温这个共同推手。相关系数的绝对值越接近1,只能说两条走势贴得越紧,没说谁驱动谁。

回归回答的是“动多少”。简单线性回归会拟合一条直线,用斜率表示自变量每变动一个单位,因变量平均变动多少。还是充电桩的例子,若以“每平方公里桩数”为自变量,以“每千人新能源车注册量”为因变量,某城市拟合出的斜率约为2.3。意思是桩密度每增加1个单位,车注册量平均多2.3个单位。注意“平均”两个字,它不承诺某个具体片区一定兑现,也不代表时间上谁先谁后。

两者最容易被弄混的地方在预测场景。做趋势观察时,我们常拿回归方程外推下季度数值。这时相关系数的作用退居二线,它只告诉你拟合线对历史数据的贴合程度。如果相关系数只有0.3,回归线依然能画出来,但用它做预测,误差带会很宽。一个实际教训:曾有人用“地铁客流量”回归“沿线便利店销售额”,R²只有0.41,仍拿去预测新线路,结果首月实际值落在预测区间外。数据不支持,方程再漂亮也白搭。

反过来,相关也不能替代回归。筛选先行指标时,我们常看一堆变量与目标变量的相关系数,挑出绝对值大的几个。但相关系数大不代表边际影响大。比如“城市GDP”与“快递业务量”相关系数约0.9,可GDP每增加1亿元对应的快递增量,在不同城市差异极大。若只凭相关排序就下结论,容易把“大块头”误当“强杠杆”。

更稳的做法是两步走。第一步,用相关矩阵做初筛,剔除那些与目标变量几乎不相关的候选,缩小观察范围。第二步,对留下来的变量跑回归,看系数显著性、看残差分布、看共线性。比如分析某品类线上销量时,先把“搜索指数”“竞品价格”“促销天数”“节假日”与销量做相关,发现“促销天数”相关系数0.55,“搜索指数”0.71,后者更值得进入回归。进入后若“搜索指数”系数显著而“促销天数”不显著,就说明后者单独解释力弱,可能被前者吸收。

还有一个常见误区:把回归系数当因果效应。回归只描述条件均值的变化,不解决内生性。比如“广告投入”对“销售额”的回归系数为正,可能是广告拉动了销售,也可能是销售好的区域本来就更敢投广告。要靠近因果,需要工具变量、双重差分等设计,这已超出普通趋势观察的范畴。日常做数据简报时,我会在回归结果旁标注一句:相关不等于因果,系数不等于承诺。

总结成一句话:相关是温度计,回归是刻度尺。看走势同步性用相关,看边际变化用回归,做预测时两者互为校验。下次拿到两份数据,先问自己——我要的是“它们一起动吗”,还是“一个动多少,另一个跟着动多少”。问清楚了,工具就不会拿反。