出行数据入门:从常见问题说起
刚接触出行数据的人,最容易犯的错是拿到表就画图。一张网约车订单表,字段可能包括上车时间、下车时间、起终点经纬度、里程、时长、实付金额。看着齐全,但直接算平均时长,结果会被极端值带偏:某天暴雨,几笔订单时长超过两小时,均值立刻从23分钟跳到31分钟。正确做法是先看分布,把超过99分位数的记录单独标记,再决定是截断还是分组。数据入门的第一课,不是分析,而是确认你手里这份数据到底代表什么。
第二个常见问题是口径不一致。同一个城市,交通部门公布的轨道交通日均客流,和某地图App统计的出行量,数字可能差三成。原因不在谁造假,而在统计范围:前者只算进站刷卡,后者可能包含步行接驳和换乘重复计数。做走势对比时,如果两条线的口径不同,交叉点毫无意义。我的习惯是,任何一张趋势图下面都标注三件事:数据来源、统计周期、是否去重。这三个信息缺一个,图就只是装饰。
第三个坑是样本偏斜。想观察早高峰通勤特征,却只拿了某写字楼周边的共享单车数据。结果发现7:30到8:30是峰值,于是得出“早高峰集中在8点前”的结论。但住在郊区、坐地铁进城的人,6:30就已经在路上了,他们的数据不在这个样本里。更稳妥的做法是交叉验证:用地铁刷卡数据看进站时间分布,用共享单车数据看接驳时间,两者对照,才能拼出完整的出行链。观察不是盯着一个数据源看,而是让多个来源互相解释。
第四个问题关于预测。出行数据天然带周期:工作日双峰、周末单峰、节假日前后偏移。有人用过去30天的均值预测明天,遇到周五就低估,遇到周一就高估。改进方法不复杂,先把日期分成工作日、周末、节假日三类,再在每类里取最近4周的中位数。某共享单车团队用这个方法预测次日早高峰投放量,误差从18%降到7%左右。预测的价值不在于精确到个位数,而在于给出一个合理的区间,并说清楚什么情况下会失效。
第五个问题是忽视外部变量。出行数据很少只由出行本身决定。一场演唱会散场,周边道路的网约车订单量可能在20分钟内涨4倍;一条地铁线临时跳站,沿线共享单车订单会立刻上浮。如果分析时只看历史走势,不叠加天气、事件、政策这些外部信息,模型很容易在异常日翻车。我的做法是建一个简单的“事件日历”,把已知的演唱会、马拉松、暴雨预警提前标进去,分析时先剔除这些日期,再看基础规律。
最后说一个实操建议:从最小可用数据集开始。不要一上来就接全量订单,先拿某一周、某一个区域、某一种出行方式的数据,把清洗、口径、可视化跑通。比如只取某地铁站周边500米内、工作日的共享单车订单,字段保留时间、起点、终点、时长四项。跑完一遍,你会对数据里的噪声、缺失和异常有具体感受,再扩展到更大范围时,心里就有底了。出行数据分析的门槛不在工具,而在对数据生成过程的理解。
总结下来,常见问题无非五类:字段含义不清、口径不统一、样本偏斜、预测忽略周期、外部变量缺位。每一个都不难解决,难的是养成习惯:拿到数据先问怎么来的,画图之前先看分布,下结论之前先找反例。做到这三点,出行数据的观察和解读就不会太离谱。