体育数据观察:几个常被问到的老问题
做体育数据观察这几年,后台收到的问题翻来覆去就那么几类。不是问某场比赛怎么走,就是问某个模型准不准。这些问题本身没错,但提问的方式常常预设了一个前提:数据能直接给出答案。实际做下来,数据更多是帮我们排除一些可能性,而不是替我们做判断。
问得最多的是样本量。有人拿着最近五场比赛的场均得分来问,说某队进攻明显下滑。五场是什么概念?一支篮球队一个赛季打八十多场,五场只占百分之六。我翻过一些公开的赛事数据,单场得分波动幅度经常在正负十五分以上,五场的均值很容易被一场大胜或一场崩盘带偏。足球更明显,射门转化率这种指标,十场以内的波动基本没有解释力。至少要看半个赛季,最好跨赛季,才能把偶然性压下去。
第二个高频问题是赛程密度的影响。这个确实存在,但被过度简化了。有人看到某队七天打三场就断言体能崩盘,可数据里还藏着轮换、主客场、对手强度这些变量。拿足球举例,欧战球队在周四踢完客场、周日再踢联赛,跑动距离通常会掉百分之五到八,但掉得最多的是高强度冲刺,不是总跑动。只看总跑动,容易得出错误结论。另外,赛程密的影响对不同位置不一样,边后卫和前锋的衰减曲线往往比中后卫陡。
数据源差异也是个绕不开的坑。同一场比赛,不同平台给出的控球率能差三到五个百分点,传球成功率差两个点以上。原因在统计口径:什么算一次成功传球,什么算一次对抗,各家定义不完全一样。做走势对比时,如果前后换了数据源,曲线看着平滑,实际是口径变了。我一般建议固定一个源,并且把统计规则说明找出来读一遍,哪怕只读关键那几段。
说到走势,很多人默认它线性外推。实际数据里,走势经常是阶段性的。一个球队的进攻效率可能连续六场走高,然后突然横盘,原因未必是状态下滑,可能是对手开始针对性布置。这时候还按原来的斜率去推,误差会累积。观察走势更实际的做法是分段看,把赛程、人员变动、主客场这些切点标出来,再看每一段内部的走向。
预测这个词在这行被用得太随意。严格讲,数据能做的是概率估计,不是预测。拿点球大战举例,历史命中率大概在七成五上下,但具体到某个球员某场比赛,这个数字提供的信息很有限。模型输出的是长期频率,不是单次结果。把概率当成预言,是很多误读的来源。
还有一个常被忽略的问题:数据是二手甚至三手的。比赛画面转成事件,事件转成统计,统计再转成指标,每一步都有损耗。比如一次进攻,现场记的是射门,转播方可能记成被封堵,数据商再归类成角球或界外球。链条越长,细节丢得越多。做观察时,能回到原始事件就别只看汇总指标,哪怕多花点时间。
这些问题没有一劳永逸的答案。数据观察的价值,不在于给出确定结论,而在于把模糊的直觉拆成可以检验的部分。样本够不够、口径一致不一致、走势有没有断点,这些检查做完,很多问题自己就消解了。剩下的那些,才是真正值得继续看下去的。