数据使用的伦理边界:我的观察笔记
去年底整理项目复盘,翻到一份用户调研记录。团队想优化推送时间,从后台拉取了30万条点击日志。数据本身没问题,但有人提议:把用户按“深夜活跃”和“工作时间活跃”分成两类,再结合注册时填写的职业,看看能不能推出“自由职业者”或“夜班族”标签。这个提议在会上停了不到两分钟,被产品负责人否了。理由很直接:职业是用户主动填的,但“夜班族”是我们推出来的——这个标签一旦进入用户画像,下次做活动就可能默认给这群人推凌晨的券。他们没同意过这种用法。
这件事让我开始系统记录项目里那些“能用但该不该用”的时刻。第一个反复出现的边界,是敏感属性的推断。比如从收货地址判断收入水平,从浏览时长判断是否有孩子,从设备型号和换机频率判断经济状况。技术上都不难,甚至不需要额外采集,现成的数据就能跑出走势。但问题在于:用户提供这些数据时,脑子里想的是“完成这次配送”或“记录运动步数”,不是“被分析”。一旦用这些数据做预测,等于把用户没打算分享的信息拿走了。我后来给自己定了一条:任何涉及健康、收入、家庭结构、性别的推断性标签,一律不进正式报表,只允许在匿名聚合层面看趋势。
第二个边界出现在模型预测的使用上。有个季度我们做流失预警,模型给每个用户打了分,从0到1。技术同学建议:对0.7以上的用户直接发挽留券,对0.3以下的不用管。这个策略本身效率很高,但运营同学提了一个问题——0.65和0.72的用户,体验上有什么区别?如果按0.7一刀切,那些分数略低的人被忽略,分数略高的人被过度打扰。更麻烦的是,模型用的特征里有一个“最近一次登录间隔”,这个指标本身波动很大,今天0.68明天可能0.74。后来我们改成了分层:0.6以上进观察池,0.8以上才触发人工复核,而且每周重新跑一次,避免一个预测结果被当成永久结论。
第三个边界比较隐蔽,跟图表有关。有次做用户增长复盘,一张图把“新增用户数”和“客服咨询量”放在同一时间轴上,两条线走势几乎同步上升。视觉上很容易读成“新增导致咨询增加”。但稍微拆一下数据就会发现:那段时间正好是版本更新,新增和咨询都是结果,共同原因是改版。如果这张图拿给业务方看,对方很可能直接下结论说“少拉新就能减少客服压力”。图表不撒谎,但它的暗示会。从那以后,我在任何包含两条以上走势线的图里,都强制加一行注释:相关不等于因果,请结合事件时间线判断。
这三次经历让我慢慢攒出一份自己的操作清单。第一,采集前问一句:用户知道这些数据会被这样用吗?如果答案模糊,先停。第二,做预测时区分“辅助决策”和“自动执行”——前者可以给建议,后者必须有阈值和人工出口。第三,出图时把时间轴上的关键事件标出来,别让走势线自己讲故事。第四,每季度清一次标签库,把那些“当初觉得有用但从未真正影响决策”的字段删掉。数据囤着不用,本身就是风险。
还有一个容易被忽略的点:退出机制。我们做过一个用户调研,问“如果知道平台用你的浏览记录推测兴趣,你还会正常使用吗?”1200份有效问卷里,41%的人选了“会减少使用”,19%的人选了“会换平台”。这两个数字放在一起,比任何伦理宣言都直接。所以现在的项目里,我会在数据看板旁边留一个说明:哪些字段在用、用来做什么、保留多久、怎么申请删除。写清楚之后,反而没人再提那些擦边的用法了——因为写下来本身就让人犹豫。
最后说一个反直觉的观察。很多人以为伦理边界是限制效率的,但我自己的记录是:把边界划清楚之后,迭代速度反而快了。原因很简单——不用反复争论“这个能不能用”,直接对照清单:能,就走流程;不能,就换方案。去年下半年我们砍掉了三个推断性标签,但推送打开率没降,因为省下来的时间被用在了内容匹配上。数据是工具,不是目的。工具用在哪,比工具有多锋利更重要。