科技公司给未成年人做专门版本,加上家长监护和年龄检测,原本被视作最稳妥的合规动作。

但遮羞布很快被撕了下来。在经历超过 4,000 次提示词的压力测试后,非营利机构常识媒体(Common Sense Media)旗下的青年 AI 安全研究所直接将专版 ChatGPT for Teens 评定为不可接受的风险,并正式呼吁在独立测试验证其安全性之前,应当全面停止向青少年开放该项服务。

实测击穿的不是简单的敏感词拦截,而是 OpenAI 极力宣扬的监护防线。十多个绑定了家长账号的新建测试账户,在长达一小时探讨自杀、自残和进食障碍的显式对话里,家长端警报几乎完全静默;在超过四分之一被临床专家判定必须提供危机转介的险境下,系统甚至没有给出任何专业求助渠道。

ChatGPT for Teens 核心测试失效指标 >25% 危机转介缺位率 专家认定的危险场景 未提供专业求助资源 极少数 家长警报触发率 一小时显式自残对话 多数测试轮次彻底静默 0次 行为识别切换 明示13岁并持续多日 成人账号未切入青少年版

评级落差背后的死穴:不是通用问答,而是伪心理咨询

梳理评测报告会发现公众认知与机构定级之间存在明显的口径落差。Common Sense Media 给予 ChatGPT-5 的综合安全评级实际是高风险,只有在青少年心理健康支持这一垂直细分场景下,才亮出了最高等级的不可接受风险。

算法无法替代临床审慎,空置诊椅映射青少年心理干预的专业缺位(示意图)
算法无法替代临床审慎,空置诊椅映射青少年心理干预的专业缺位(示意图)

让 ChatGPT 讲解微积分、润色作文或拆解物理公式,模型展现出的能力依然在可控区间。真正的风险爆发点在于青少年群体正高频把对话机器人当成全天候的情感寄托与心理医生。AI 展现出的自信语调与高共情拟人化回应,让心智尚未成熟的未成年人产生强烈的错位信任;一旦对话滑向抑郁或自毁情绪,算法给出的安慰往往缺乏临床审慎性,反而可能阻碍他们向现实中的专业医生或监护人求助。

ChatGPT 青少年防护:官方承诺与实测断层对照 产品设计宣称的防御 • 年龄预测算法自动拦截高危 prompt • 绑定家长账户实时监控对话状态 • 触碰危机词汇强制触发自残警报 • 引导学生回归学习场景而非闲聊 实验室多轮评测暴露的问题 • 多轮文本交互下安全护栏持续衰减 • 遗漏躁狂症与精神病隐蔽求助信号 • 自残警报常态化延迟超 24 小时 • 过度顺应危险念头、延误现实救助

官方辩解称测试脱离了实际运行逻辑。发言人 Eric Porterfield 表示家长警报在绑定后需要数小时才能完全激活,而抓取伪装成成年人的行为年龄预测系统需要收集多维信号,通常需要长达两周的运行周期。

但急性心理危机从来不会按算法的节奏发生。青少年的自毁冲动往往爆发在几个小时甚至几十分钟之内,没有人会提前两周通知算法自己正在陷入绝境。

翻开官方支持文档,答案写得很直白:家长警报并非算法全自动实时触发,而是依赖后台人工审核员识别严重自残风险后再行派发,文档本身就承认存在遗漏和延迟的可能。把一套依赖人工排队流转、带有冷启动周期的非实时工单机制包装成紧急监护盾牌,这种错位给家长制造了极其危险的幻觉。

实验室实测穿透:多轮交互下的对齐衰减

单轮对话里的关键词过滤早已不再是技术难点。让评测机构亮出红牌的直接证据,来自严苛的多轮对话压力测试。

多轮长对话逐渐消解大模型预设的安全防护边界(示意图)
多轮长对话逐渐消解大模型预设的安全防护边界(示意图)

2025 年 11 月 20 日,Common Sense Media 联合斯坦福医学院 Brainstorm 实验室发布测试报告。研究人员模拟了覆盖 13 种心理健康状况的真实场景,横向对比了 ChatGPT-5、Claude Sonnet 4.5、Gemini 2.5 Flash 以及 Meta 旗下的 Llama 4 模型。测试得出的普遍规律是,主流模型在面对单句直接表达自杀意图时,均能较好地弹出求助热线;可一旦进入 5 轮以上的隐蔽交流,所有模型的安全护栏都出现了明显的衰减退化。

在涉及精神病倾向、双相情感障碍中的躁狂状态以及重度注意缺陷与多动障碍(ADHD)的隐蔽交流中,大模型频繁遗漏求助信号。由于大语言模型在底层对齐机制上天然倾向于讨好用户,系统会在上下文拉长后不自觉地顺应青少年的危险认知,甚至对虚妄信念表达赞同。对于需要医学介入的病理状态而言,这种顺应无异于推波助澜。

防得住具体的自残教程,却防不住温水煮青蛙式的情感依赖。

平台 / 模型未成年人准入策略家长监护形态危机干预机制
OpenAI (ChatGPT)专设青少年版 (13-17岁)账号绑定警报 (非实时人工)拒绝生成操作,但转介与警报迟钝
Anthropic (Claude)严格限满 18 岁以上不提供家长监护功能显式危机坚决触发 988 求助资源
Google (Gemini)依托生态账户准入Family Link 设备访问级控制未公开专项自杀语义检测报警

Anthropic 的做法是干脆一刀切:Claude 明确要求年满 18 岁,不给未成年人做温和改良版的承诺,但在检测到显式危机输入时坚决弹出 988 危机求助热线。Google Gemini 则依托成熟的 Family Link 在设备和应用层卡住访问权限,并不去声称自己能精确解析自杀语义并实时报警。

唯独 OpenAI 试图两头兼顾:既要未成年人这块庞大的日活与未来用户市场,推出了青少年安全蓝图与 Under-18 Model Spec;又要向家长和公众许诺这套系统是受控的。

延迟 24 小时的警报,与正在收网的司法追责

从 OpenAI 推进产品的时间表可以清晰看出其工程防御的演进路径:

未成年人极端危机触发的家长警报滞后超二十四小时
未成年人极端危机触发的家长警报滞后超二十四小时
OpenAI 未成年人安全防御与评测节点 2025 年 9 月 29 日 上线基础家长控制 2026 年 1 月 20 日 引入年龄预测机制 误判需 Persona 验证 2026 年 8 月 18 日 ChatGPT for Teens 正式面向 13-17 岁启用 2026 年 10 月 7 日 CSM 评测认定其 存在不可接受风险

OpenAI 于 2025 年 9 月 29 日率先上线家长控制,2026 年 1 月 20 日部署了基于行为特征的年龄预测技术,被系统误判为未成年人的成年用户必须通过第三方身份工具 Persona 验证身份才能解除限制。随后在 2026 年 8 月 18 日,官方正式推出了自动启用的 ChatGPT for Teens。

但这套机制在现实执行中出现了严重脱节。独立测试证实,系统声称的家长端紧急通知机制极不可靠,极端危机事件的家长警报滞后超过 24 小时,很多轮次甚至彻底静默。

这一套安全蓝图原本是 OpenAI 应对诉讼的核心防御工事。2025 年 4 月,16 岁少年 Adam Raine 自杀,家属于同年 8 月正式起诉 OpenAI 及 Sam Altman,指控模型持续强化了少年的自杀意念。在同类案件中,涉 14 岁少年 Sewell Setzer III 自杀案的 Character.AI 及其创始人与 Google,已于 2026 年 1 月同家属达成庭外和解;而 Character.AI 更早在 2025 年 11 月 24 日就彻底下架了面向美国 18 岁以下用户的开放式聊天功能。

OpenAI 本想证明自己通过技术手段尽到了注意义务,但 Common Sense Media 的详尽报告把这套说辞击得粉碎。佛罗里达州总检察长此前已于 2026 年 6 月 1 日对 OpenAI 提起诉讼,并于 9 月 28 日正式申请针对其运营与模型开发的临时禁令,试图彻底禁止未成年人访问 ChatGPT。

古人讲虑之贵详,行之贵力。科技公司习惯了先上线再打补丁的敏捷法则,但这套逻辑不能直接挪用到未成年人的心理危机干预上。做不到实时拦截就承认能力边界,而不是用一套充满延迟的人工审核机制给监护人提供虚假的安全感。虚妄的盾牌,比赤手空拳更让人麻痹。

  • 建议.在厂商彻底解决多轮长上下文的安全对齐衰减与实时告警延迟之前,家长切勿将所谓的青少年版当作可以完全放手的安全围栏。