出行数据入门:从刷卡记录看城市节奏
地铁闸机的刷卡记录,大概是普通人最容易接触到的出行数据。北京某线路早高峰7:30到8:30的单向进站量能到两万多人次,平峰同一小时不到三千。这两个数字摆在一起,不用任何模型,就能看出通勤潮汐的方向。入门出行分析,第一步不是学算法,而是找到这种有明确时间标签的数据源。公交刷卡、共享单车订单、网约车上下车点,都带时间戳和坐标,天然适合做时间序列的观察。
拿到数据后先做一件枯燥但关键的事:清洗。以共享单车订单为例,原始表里常有骑行时长超过24小时的记录,多半是忘记锁车而非真实骑行。还有起终点坐标落在河道或建筑内部的,属于定位漂移。这些异常值如果不处理,计算平均骑行距离时会被拉偏。一个粗略的经验是,先按分位数砍掉前后1%的极值,再检查剩下的分布是否合理。清洗掉多少条记录、占比多少,最好在分析笔记里写清楚,这是数据可复现的基础。
清洗之后才谈走势。出行数据最典型的特征是周期性:工作日双峰、周末单峰、周五晚间延长。拿某城市地铁全网进站量来说,周一至周四的晚高峰通常在18:00前后达到峰值,周五会往后拖半小时左右,峰值也略高。这种规律不是巧合,背后是通勤与休闲出行的叠加。观察走势时,建议把不同星期的同一时段放在一张图上对比,而不是只看一条折线。单条曲线看不出异常,多条曲线叠在一起,哪个周五特别突出就一目了然。
出行数据里有个容易踩的坑:把因果关系想得太直接。比如某月地铁客流下降,第一反应可能是天气变冷。但翻看同期数据会发现,那条线路附近有两站因施工封站,分流效应更明显。再比如节假日景区周边的网约车订单激增,未必是游客变多,也可能是公共交通运力临时调整。做预测之前,先列一遍可能影响数据的外部事件:天气、施工、大型活动、票价调整。这些信息不在数据表里,却直接决定走势是否可信。
说到预测,出行数据的短时预测比长时预测靠谱得多。预测未来15分钟某路口的车流量,用历史同期的平均值加实时修正,误差通常能控制在可接受范围。但预测三个月后的客流,变量太多,参考价值有限。入门阶段不妨把预测目标定小一点:预测明天早高峰某站进站量是否超过本周均值。这样的问题有明确答案,也能验证方法是否有效。预测错了,回头找原因,比追求一个漂亮的大模型更有收获。
数据之外,还需要一点实地观察。有研究者发现,某地铁站早高峰出站量远大于进站量,按常理这是就业中心。但实地走一圈才注意到,出站人群多数拐进了旁边的长途客运站,并非去写字楼上班。刷卡数据只记录进出,不记录目的,坐标只记录位置,不记录意图。把数据结论和地面观察对照,能避免不少误判。出行分析的门槛不高,难的是对数字保持怀疑,对场景保持好奇。
对入门者来说,一套可行的流程是:选一条线路或一个片区,拉取连续四周的刷卡或订单数据,做基础清洗,画出分时走势,标注异常日期,再尝试预测下一周的早高峰峰值。整个过程不需要复杂工具,电子表格加一张折线图就能起步。重点在于养成记录假设和验证结果的习惯。数据不会自己说话,但认真对待每一行记录的人,能从出行轨迹里读出城市运转的节奏。