中盾观察
首页 / 图表笔记 / 正文

数据使用的伦理边界:从一张趋势图说起

栏目:图表笔记 | 约1613字 | 2026-09-13

去年底,某城市交通部门公开了一份地铁刷卡数据。研究者把连续七天的进站记录按小时聚合,画出一张客流走势图。图很干净:早高峰尖峰在7:40到8:10之间,晚高峰散得更开。但如果把聚合粒度从小时缩到分钟、再加上站点编号,就能反推出某个人每天几点出门、在哪站换乘。同一份数据,聚合方式不同,指向的伦理状态也不同。这张图后来被撤下,不是因为数据假,而是因为太真。

这类问题在图表笔记里反复出现。做观察的人习惯追问:这个走势说明了什么?但更前置的问题是:它本不该被画出来吗?我给自己定过一条土办法:拿到一份数据,先不看它能不能预测,先问三个问题——谁记录的?记录时对方知道吗?如果知道,他同意被这样用吗?三个问题里有一个卡住,这张图就暂时不画。

先看匿名化。很多人以为删掉姓名和身份证号就安全了。2018年有研究者在《自然·通讯》上发过一篇短文,用15个时间戳和少量位置点,就能在150万人的移动数据里重新识别出95%的个体。15个点是什么概念?一个人半天里刷手机、过闸机、连Wi-Fi留下的痕迹,远不止15个。所以匿名化不是删字段,而是控制维度组合。一张按街道聚合的房价走势图,和一张按门牌号聚合的图,伦理重量完全不同。我的做法是:凡是能落到个人时间线的字段,先降一级——小时降成天,站点降成区域,精确金额降成区间。降完再看,预测能力还剩多少。如果降完图就废了,那说明这张图本来就在靠个体信息撑着。

再看聚合。聚合是数据伦理里最实用的缓冲带,但缓冲带也有厚度问题。某招聘平台曾发布过一份行业薪资观察,按城市和岗位大类给出中位数。这个粒度没问题。后来有人把它拆到“城市+岗位+工作年限+学历”,某些格子里只剩两三个人。格子越小,越接近个体。统计上有个经验:聚合单元少于5个样本时,发布方就该考虑合并或抑制。这不是数学洁癖,是防止读者用排除法还原。我自己画图时会在代码里加一行:如果某组样本量低于阈值,该点直接置灰,不显示数值。图上会多几个空洞,但空洞本身就是信息——它在说,这里的数据不够厚,别急着下结论。

知情同意是第三条,也是最容易被绕过的。绕过的典型话术是“数据已经脱敏”。但脱敏解决的是识别问题,不解决授权问题。一个人授权平台用他的数据改进推荐,不等于授权平台用这些数据去研究他的情绪波动。用途变了,同意就失效。欧盟的GDPR把这条写得很细:目的限制原则,收集时的目的就是使用边界。国内《个人信息保护法》也有类似表述。实践里怎么落地?我见过一个还算克制的做法:某健康App想做用户步数与睡眠的走势分析,没有直接跑全量数据,而是先弹窗说明用途、给出现金或会员补偿、允许随时退出。最终同意率不到四成。样本少了,但这份观察站得住。用四成有明确同意的数据,比用十成默认勾选的数据,结论更经得起追问。

把这三条合起来,可以做成一张很简单的检查清单。第一步,列出数据里所有能落到个人的字段,逐项问“能不能再降一级”。第二步,检查每个发布单元的样本量,低于阈值就合并或隐藏。第三步,核对收集时的授权用途,如果当前用途不在其中,要么重新获得同意,要么放弃。三步都过了,再开始画图。清单不复杂,麻烦的是每次都得走一遍。我自己的记录里,大约有三分之一的数据集卡在第一步或第三步,最后没进入分析。

有人会问,这么收着,还怎么做趋势判断?我的观察是,收着做反而更稳。去年我参与过一个消费信心的小型观察,因为坚持只发布月度、分大区的聚合值,样本损失了近一半。但那份走势图后来被几个团队引用,没有人质疑它的来源。伦理边界不是给数据工作加锁,而是给结论上保险。边界清楚的数据,预测错了可以复盘;边界模糊的数据,预测对了也不敢用。

最后回到那张被撤下的地铁图。它的问题不在于揭示了什么,而在于揭示的方式越过了被记录者的预期。数据不会自己说“可以”或“不可以”,说这话的是用数据的人。每次准备画一张走势图之前,先停三秒,想想图里那些点背后站着谁。这三秒,大概就是伦理边界的起点。