中盾观察
首页 / 图表笔记 / 正文

数据使用的伦理边界:几个常见问题

栏目:图表笔记 | 约1196字 | 2026-09-08

做数据观察这些年,有一个感受越来越明显:技术上的可行,和伦理上的可接受,中间隔着一道很宽的沟。这道沟平时看不见,一旦出事,往往已经晚了。

先说最常见的一个问题:采集范围。很多产品在注册时要求授权通讯录、位置、相册,理由是“优化体验”。但2021年某输入法被曝出,即使用户关闭了定位,它仍通过Wi-Fi列表推断大致位置,误差在百米以内。这不是个例。有研究团队抽查了1000款常用App,发现其中37%索要的权限与核心功能无关。用户点“同意”时,多数人不会逐条看,平均停留时间只有1.8秒。这个数字本身,就是伦理问题的起点。

第二个问题更隐蔽:标签固化。系统给一个用户打上“价格敏感”标签,可能只是因为他某次用了优惠券。但这个标签会跟随他很久,影响后续看到的商品、推荐、甚至客服响应。有电商平台内部测试显示,被标记为“低价值”的用户,其投诉处理时长平均比普通用户多出4.2小时。数据本身没有恶意,但用数据做判断的人,很容易把相关性当成因果,把一次行为当成永久属性。这种固化一旦形成,用户很难自证清白。

第三个问题关乎预测的边界。预测是数据应用的核心能力之一,但预测用在哪里,差别很大。用走势判断库存、调度运力,这是效率问题。用走势判断一个人会不会违约、会不会离职、会不会生病,这就进入了伦理地带。某招聘平台曾上线“离职倾向”评分,综合了登录频率、简历更新、社交活跃度等十几项指标。虽然平台强调只是辅助参考,但已有企业将其作为调岗依据。一个员工可能只是最近多看了几篇行业文章,就被系统认为“心不稳”。这种预测的误差成本,由被预测者承担,而模型开发者几乎不付出代价。

第四个问题在数据二次使用时集中爆发。用户为A目的提供的数据,被用于B目的,这在实践中非常普遍。比如,为健康管理上传的步数、心率,可能被用于保险定价;为找房填写的收入范围,可能被用于信贷额度评估。欧盟GDPR实施后,有统计显示,因“目的限制”条款被处罚的案例占全部罚款的23%。国内《个人信息保护法》也明确要求,处理个人信息应当具有明确、合理的目的。但现实中,一份隐私政策往往涵盖几十种使用场景,用户根本无从判断自己的数据最终流向哪里。

这些问题的共同点在于:数据使用的收益和风险不对称。平台获得效率提升、成本下降,用户承担隐私泄露、标签歧视、预测误判的后果。要划清边界,至少需要三条线。第一,采集最小化,能不用就不用,能少用就少用。第二,使用透明化,让用户知道数据被用来做什么,而不是藏在几千字的协议里。第三,预测可申诉,当算法做出对用户不利的判断时,用户有权知道理由,并有机会更正。

回到观察本身。我们每天看各种数据,看走势、看结构、看异常。但数据背后是一个个具体的人。伦理边界不是要限制数据价值,而是让这种价值可持续。一个用户今天被误判,明天可能就流失了。一个平台今天越界,明天可能就面临监管和信任的双重代价。边界感,说到底是一种长期主义。