中盾观察
首页 / 数据方法 / 正文

出行数据怎么读?从早晚高峰看城市走势

栏目:数据方法 | 约1422字 | 2026-09-23

很多人第一次接触出行数据,是从一张地铁客流图开始的。横轴是时间,纵轴是进站量,一天画下来,两条驼峰明显——早上一座,傍晚一座。这两座驼峰的位置、高度、宽窄,其实藏着不少信息。比如某城市早高峰出现在7:45到8:15之间,峰值进站量约12万人次每小时;晚高峰则从17:30延续到18:40,峰值略低但持续时间更长。单看这个数据,你能判断这是一座通勤方向比较集中的城市,早上大家往同一个方向赶,晚上回来时间却分散一些。

观察出行数据,第一步不是急着做预测,而是先弄清数据的采集口径。地铁刷卡数据记的是进站和出站,网约车订单记的是上车点和下车点,公交刷卡则可能只记上车不记下车。口径不同,能回答的问题就不同。举个例子,你想知道某个商圈晚上的吸引力,用地铁出站数据比用进站数据更合适,因为出站才代表到达。但如果你手上只有公交上车数据,那就只能看这个商圈周边站点有多少人上车,不能直接说有多少人到这里来。很多初学者在这一步犯错,把不同口径的数据混在一起比较,结论自然站不住脚。

把时间拉长到一周,出行数据的走势会呈现出更清晰的节律。工作日五天的曲线高度相似,但周一早高峰往往略高,周五晚高峰则更早开始。周末又是另一套逻辑:早高峰消失,上午10点到11点出现一个小峰,下午的峰值比工作日更平缓。有研究者对比过某二线城市半年的地铁数据,发现周六的客流总量约为工作日的78%,周日在70%左右,但周日下午的返程小高峰比周六高出约15%。这些数字本身不复杂,关键在于它们能帮你建立一个基准线——知道“正常”长什么样,才容易发现“异常”。

说到异常,出行数据最有价值的地方之一,就是它能比较快地反映城市状态的变化。2023年某地举办大型展会的那几天,周边地铁站早高峰进站量比前一周同期下降了约9%,而出站量上升了22%。下降和上升同时出现,说明这个区域从“居住地”临时变成了“目的地”。类似的信号还有网约车订单的起终点分布:如果某个区域连续几天出现大量短距离订单,起终点都集中在两公里范围内,那可能意味着这里有新的商业设施开业,或者某个交通接驳点发生了变化。这些观察不需要复杂模型,只需要你把每天的数据放在同一张表里对比。

当然,从走势到预测,中间还隔着不少工作。出行数据有明显的周期性,工作日和周末要分开建模,节假日又要单独处理。天气的影响也不小:一场中雨能让晚高峰的网约车订单提前约20分钟,同时把订单密度推高15%到30%。如果你用包含雨天的数据去预测晴天的客流,误差就会偏大。比较稳妥的做法是先把数据按“工作日/周末/节假日”和“晴/雨”分组,分别看走势,再决定要不要合并。很多看起来复杂的预测问题,拆开之后其实只是几个简单规律的叠加。

对刚入门的人来说,不必一上来就追求精准预测。更实际的目标是:能说清楚一条曲线为什么长这样。比如你看到某条地铁线早高峰进站量连续三周下降,可以去查沿线是否有施工封路、共享单车投放变化、或者附近公司调整了上班时间。找到原因,比调参更有收获。出行数据的好处是反馈快——今天观察到的变化,明天就能用新数据验证。这种“观察—假设—验证”的循环,做上几十次,对数据的敏感度自然就上来了。

最后提醒一点:出行数据涉及大量个人信息,公开数据通常是聚合后的结果。分析时要注意样本量和聚合粒度,太细的切分可能既不可靠也不合适。入门阶段,用城市级或站点级的小时数据练手就够了。等你能从这些粗颗粒的数据里读出城市的呼吸节奏,再往更细的方向走,会踏实很多。