中盾观察
首页 / 数据方法 / 正文

出行数据分析入门:从一张刷卡表说起

栏目:数据方法 | 约1300字 | 2026-09-13

很多出行数据分析的第一课,不是建模,而是打开一张表。比如某城市地铁某站一天的进站刷卡记录,通常包含卡号、进站时间、站点编号几个字段。看起来很简单,但真正动手前先问三个问题:这张表覆盖了多长时间?是否包含换乘重复计数?时间戳是精确到秒还是分钟?我见过一份数据,两个字段名都叫time,一个是进站、一个是出站,直接合并就会把行程方向搞反。花十分钟确认口径,比后面返工两小时划算。

清洗阶段最常处理的是异常值。以某站早高峰7:00—9:00为例,正常进站量大约在每小时3000到5000人次之间。如果某天7:30突然出现12000,先别急着下结论说“客流暴涨”,更可能是前一天设备故障导致数据补传,或者系统把出站记录误标成进站。处理办法是拉出前后三天的同一时段做对比,看这个尖峰是否只出现一次。孤立的高点通常要打问号,连续三天的同步抬升才值得进一步分析。

把时间切细,是观察出行规律的基本功。按15分钟聚合,一个工作日的进站量会呈现明显的双峰结构:早高峰峰值一般落在7:45—8:15,晚高峰在17:45—18:15。但不同站点差异很大。住宅区周边站点早高峰进站量可能是晚高峰的1.5倍,而写字楼周边站点正好反过来。这就是走势的站点属性:同样是早高峰,有的站在“输出”人流,有的站在“接收”人流。只看全网总量,会把这两种相反的方向平均掉。

想做短时预测,先别上复杂模型。一个可用的起点是移动平均加周期因子。具体做法:取过去四周同一星期几、同一15分钟段的进站量,求均值作为基准,再乘以当天的天气或节假日调整系数。以某站周二8:00为例,过去四周均值是4200人次,如果当天有小雨,历史同类天气下客流约下降8%,那么预测值可以给到3860左右。这个方法不精确,但胜在可解释,且能快速给出一个参照线。真实项目里,它常被当作基线,用来判断更复杂的模型是否真的带来了提升。

数据质量往往决定分析上限。出行数据里常见的坑包括:节假日和调休打乱星期规律、大型活动带来一次性冲击、设备离线造成整段缺失。应对方式不是删掉了事,而是给每条记录打上标记。比如把日期分成工作日、周末、法定节假日、调休工作日四类,分别统计。这样再回头看走势,就不会把国庆期间的下降误判成趋势性下滑。缺失值则可以用前后同时段插值补上,但要记录补了多少,超过5%就要在结论里说明。

可视化是检验理解的手段,不是装饰。把一天96个15分钟段画成折线,横轴是时间,纵轴是进站量,多条线代表不同星期几。如果几条线在早高峰几乎重合,说明该站通勤属性稳定;如果某条线整体平移,先查那天是不是有特殊事件。更实用的做法是画热力图:横轴一天24小时,纵轴一周七天,颜色深浅表示客流量。一眼就能看出哪几个格子是固定高峰,哪几个格子是异常点。图看多了,对数据的直觉会慢慢建立起来。

最后提醒一点:出行数据涉及大量个体轨迹,分析时尽量停留在聚合层面。按站点、按时段统计,通常足够回答大部分业务问题;一旦下钻到具体卡号,就要考虑授权和脱敏。入门阶段,把精力放在口径确认、时段切分和基线对比上,比追求模型复杂度更有价值。一张表、一个月的数据、几个固定时段,就足以练出一套可复用的观察方法。