数据使用的伦理边界:从一次用户画像争议说起
一家生鲜电商曾向部分用户推送“孕期专属”优惠券,一位父亲投诉后才得知,自己读高中的女儿被算法判断为怀孕。系统依据的是她近期搜索记录、浏览时长和购物车变化。这个案例常被拿来讨论隐私,但更值得琢磨的是:当数据足以生成一个连本人都未意识到的标签时,使用它的边界在哪里?
数据使用的第一层边界是知情同意。现实中的同意往往是一份长达数十页的协议,用户点击“同意”的平均停留时间不足3秒。2022年某机构测试了50款常用应用,其中32款的隐私政策包含“可能将数据用于模型训练”的条款,但仅7款在首次弹窗中明确提示。这种不对称让同意流于形式。观察近年监管动向,欧盟《数字服务法》要求平台提供“不基于画像”的推荐选项,国内《个人信息保护法》也明确,处理敏感个人信息需取得单独同意。规则在收紧,但落地效果取决于产品设计是否把选择权真正交回用户手中。
第二层边界是匿名化的幻觉。很多人以为去掉姓名和手机号就安全了。麻省理工学院的研究者曾用15个月的通话记录,仅凭四个时间点和位置点,就重新识别出95%的个体。另一项针对纽约出租车数据的研究显示,即便抹去司机姓名,通过交叉比对上下车时间和地点,仍能锁定特定司机。这意味着,数据一旦具备足够的时空粒度,匿名化就只是一道心理安慰。做趋势分析时,看到“已脱敏”三个字,最好再问一句:脱敏到什么程度?谁能反向还原?
第三层边界涉及预测的正当性。信贷机构用消费数据预测还款能力,招聘平台用行为数据预测离职概率,保险公司用驾驶数据预测出险风险。预测本身是中性的,问题在于预测结果被用于什么场景。比如,某招聘工具曾将“通勤距离长”作为离职风险因子,导致住在远郊的求职者被系统降权。这个变量与工作能力无关,却实质影响了机会分配。当数据走势被用来预判个体命运时,需要区分:这是提升效率,还是转嫁成本?
一个实用的观察框架是“三问”:一问数据来源是否可追溯,二问使用目的与收集场景是否一致,三问拒绝授权后是否仍有基本服务可用。以地图导航为例,用户拒绝持续定位,应用仍应提供手动输入起终点的路线规划。若拒绝即无法使用核心功能,那同意就带有胁迫性质。这个框架不解决所有问题,但能筛掉大部分越界操作。
回到开头的案例。那家电商后来调整了规则:涉及健康、孕期等敏感推断,不再自动触发营销,而是先以中性方式询问用户是否愿意接收相关品类信息。改动很小,效果却明显——相关投诉下降约七成,优惠券核销率反而上升。这说明伦理边界不是增长的敌人,粗糙的数据使用才是。
数据、走势、预测,这些词听起来技术味很浓,落到具体人身上却很具体。每一次模型迭代,背后都有一群被分类、被评分、被预判的个体。观察数据走势时,不妨同步记录那些被排除的变量、被忽略的拒绝、被沉默的例外。边界不是画在纸上的线,而是每次使用数据时,多问的那一句话。