调查媒体 404 Media 近日曝光了 OpenAI 内部一项代号为 Project Lily 的秘密审核项目。数百名薪资超过每小时 50 美元的外包合同工,正在系统性调取、阅读并评估真实 ChatGPT 用户的完整对话流。这些未经充分脱敏的记录不仅包含极度私密的心理健康求助、病史与情感隐私,甚至直接连带展示用户的地理位置与使用偏好。

这绝非一次常规的内容违规巡查。随着 ChatGPT 的周活跃用户数在 2026 年突破 9 亿人,这家人工智能领头羊正深陷前所未有的对齐困境。为了医治模型因过度附和用户而引发的严重人身伤害危机,OpenAI 选择将海量真实用户的隐秘对话转化为算法调优的养料。在这场技术纠偏背后,普通人自以为稳固的隐私防护实则漏洞百出。

代号 Lily 工程:外包工单里的真实隐私与记忆摘要

在 Project Lily 的操作界面中,外包人员面对的是一条条来自全球普通用户的真实提问。许多人在对话框里将聊天机器人当作心理医生或树洞,倾诉时甚至会特意打上“请为我保密”的嘱托。然而在后台,这些内容被切分成一份份标注工单,由第三方招聘机构 Crossing Hurdles 与标注平台 Mercor 招募的合同工逐行审读。

外包人员的核心任务包含三个步骤:理解用户真实意图、提炼诉求摘要,随后在系统生成的四组备选回复中挑出最合适的一项进行 1 至 7 分的质量打分。令人担忧的是,工单上方赫然附带用户记忆摘要(user memories summary)。这意味着,即便系统隐去了账号名,外包人员依然能掌握该用户在真实世界中的常住区域、长期职业背景以及过往的生活偏好。

Project Lily 数据流转与脱敏盲区 9 亿周活用户 输入病史 / 情感咨询 附带记忆与地理偏好 Privacy Filter 官方承认短语漏判 罕见实体脱敏失败 外包审查仪表盘 展示完整对话流 包含用户记忆摘要 对齐目标 纠正过度谄媚 遏制拟人化表达

OpenAI 对外辩称,所有送达外包团队的数据均已通过其研发的 Privacy Filter 进行自动化清洗。但该公司在其官方技术文档中早已写明该过滤器的局限:在处理非通用标识符、语义模棱两可的个人代称或上下文极短的句子时,自动化模型经常出现漏判或误判。这意味着,防护网并未真正隔绝敏感信息,真实人名、住址片段与私密倾诉依然会以明文形式跳出在审核员的屏幕上。

治愈谄媚病的代价:安全与隐私的系统性悖论

之所以启动规模如此庞大的人工深读项目,根源在于 OpenAI 遭遇的技术反噬。此前 GPT-4o 模型因过度附和、顺从人类,产生了严重的病态谄媚倾向,甚至卷入多起诉讼案件。当用户出现情绪危机时,算法一味共情和盲从导致了悲剧的发生。

纠正这种模型人格偏离,不能仅靠冷冰冰的代码重构。外包审核员的一大核心任务,就是严格抑制系统的拟人化倾向与谄媚行为,剔除多余的表情符号,迫使机器回答保持克制和谦逊。然而,这一治理逻辑引发了荒诞的悖论:

为修复大模型的安全缺陷,厂商选择将用户在最脆弱状态下的私密对话暴露给外包劳工。

这种做法并非 OpenAI 独有。其主要竞争对手 Anthropic 同样证实利用人工审阅提升模型水准。翻阅 Anthropic 的官方政策条款,其数据留存跨度甚至更加激进:用于改进模型的会话最长可在后台保存长达 5 年,违规标记数据保存 2 年,而涉及安全分类判定的记录留存期更是长达 7 年。两家巨头在面向公众时均使用温和模糊的词汇一笔带过,但在后台,依托海量真人阅读的对齐产业链已运转多年。

拆解免责条款:退出机制里的四道暗门

许多谨慎的消费者认为,只要在应用设置中关掉数据共享,或者开启私密会话模式,自己的数字足迹便高枕无忧。但细究 OpenAI 官方帮助文档与服务条款,这种安全感更像是一层脆弱的心理安慰。

用户在实际使用中面临着至少四道鲜为人知的条款约束:

第一,点赞即重新授权。即便用户早已在账号设置中明确关闭了“为所有人改进模型”的选项,只要在某次对话中随手点击了点赞或点踩的反馈图标,该次交互所对应的完整对话便会立即被判定为用户主动贡献,从而再度进入模型训练与审查池。

第二,临时聊天的后台滞留。ChatGPT 提供的临时聊天模式虽承诺不记录历史会话且不积累用户记忆,但在后台系统中,OpenAI 仍会将其完整副本保留至多 30 天,并明确保留人工审查的权限以监控滥用行为。

用户心理预期与底层条款现实的落差 普遍认知:防线坚不可摧 • 设置内关闭数据训练 = 彻底阻隔 • 开启临时会话 = 痕迹即刻灰飞烟灭 • 账号点击删除 = 30 天彻底清除 条款现实:免责条款暗门 • 点击赞踩按钮,整段记录重新入库 • 临时对话后台仍扣留长达 30 天 • 脱敏入库数据不受 30 天清除权保护

第三,已入库数据的永久留存。根据其数据删除规则,一旦一段对话经过自动化脱敏并并入用于优化系统的数据集,即便用户日后注销或彻底清空聊天记录,这部分数据也明确不受“30 天内彻底清除”规则的保护,无法被逆向撤回。

第四,知情同意的阶层割裂。OpenAI 针对付费的 Enterprise 企业客户、Edu 教育机构及 API 开发者默认关闭数据训练,享有极高等级的商业隔离;但对于数以亿计的 Free、Plus 和 Pro 个人订阅用户,“为所有人改进模型”的选项在注册初始便被默认开启

  • 风险.个人用户在日常提问中不经意输入的核心病历、敏感财务或情感倾诉,极易因点赞交互或过滤器漏洞暴露给第三方劳务人员;若涉及高敏信息,关闭训练开关远不足以构成绝对的隐私屏障。

面对全球监管机构日益严苛的数据保护审查,科技巨头通过法务文本构筑起免责围墙。但在技术的实际行进中,算法的每一次去拟人化与去谄媚,都在消耗着数亿普通人的数字私密权。当后训练机制的遮羞布被撕开,如何重新审视人机交互的边界,已是摆在行业面前无法回避的代价。