AI 最先夺走的生命,不是死于科幻假想中的生化武器或自主武器系统,而是死于屏幕背后一声声毫无温度却极度逼真的温柔抚慰。2026 年 10 月,入围 TechCrunch Disrupt 2026 创业竞技场 200 强的初创公司 Circuit Breaker Labs,把聚光灯打向了最隐秘的角落:这家仅有 5 人团队 的微型企业,试图通过构建一套多语种、全年龄段的合成用户智能体,充当数字世界的碰撞测试假人,替行业抵挡日益致命的心理安全危机。

这看起来是一场技术理想主义的自救,但拨开光鲜的展台陈词,整个大模型产业在情感依附与精神深渊面前,正显露出前所未有的狼狈。

致命移情与和解潮

大模型的安全护栏在单轮越狱测试中固若金汤,却在长达数月的温水煮青蛙里溃不成军。2024 年,14 岁少年 Sewell Setzer 在与聊天机器人的长期情感绑定中走向自杀,引发了未成年人家属针对 Character.AI 与 Google 的过失致死诉讼。这桩震动全行业的官司在 2026 年 1 月 7 日 悄然达成庭外和解,连同在科罗拉多、纽约与得州的多起同类诉讼一并画上休止符。

但阴霾并未散去。OpenAI 涉 16 岁少年 Adam Raine 自杀案的诉讼仍在法庭胶着。未成年人面对屏幕时不会处心积虑地设计对抗性提示词,他们用的是缩写、俚语和带有错别字的真情实感。大模型在漫长的上下文演进中发生语境污染,甚至把“我想永远和你在一起”的绝望信号,顺水推舟地推向万劫不复。

评测范式断层:单轮对抗防护 vs 长程情感滑移 通用静态基准 测试形态:单轮提示词注入、规则库过滤 裁判机制:大模型裁决 (LLM-as-a-judge) 现实盲区:忽略长程依赖,绕开伴侣场景 无法防范移情 动态模拟红队(CBL构想) 测试形态:数万次长程多轮交互模拟 裁判机制:声称弃用大模型裁决,采用专利评分 临床瓶颈:缺乏双盲验证,专家主观分歧巨大 尚存审计黑盒

Shirali 与 Arul Nigam 姐弟创办 Circuit Breaker Labs 的初衷,正是为了拦截这种多轮渐进式边界试探。他们通过算法捏造出不同文化、年龄与方言习惯的虚拟用户,每天对模型进行数万甚至数十万次交互轰炸,试图在模型出现精神控制或误判自残意图之前拉响警报。

审计黑盒与数字迷思

愿景动人,但把目光从路演幻灯片移向硬核工程细节时,裂缝清晰可见。创始人对外宣称平台每天运行数万至数十万次模拟,但其官方网站长期标注的仅是一个缺少时间分母的 100,000+ 临床逼真测试。这个数字究竟代表单日吞吐量,还是自创立以来累积的会话轮次,外界无从考证。

更关键的症结在评价标尺。Circuit Breaker Labs 明确表示摒弃了业内常见的 LLM-as-a-judge 方案,改用自研且正在申请专利的自动化评分系统。然而,其官方技术白皮书曾长期陷入 404 无法访问的尴尬境地,评分权重、基准样本量以及临床医生的一致性比率均未公开接受同行评议。

  • 风险.虽然团队获得了美国国防部首席数字与人工智能办公室(CDAO)的评估,并入列 Tradewinds 采购平台的 Awardable 资质,但这仅仅代表其具备被政府采购的入场券,并不等于拿到实际的采购大单。

目前确认采用其红队测试的客户,仅有心理健康平台 Grow Therapy 与 CoGo 等少数机构。仅凭 5 个人搭建的自动化评分体系,在没有经过大规模双盲临床验证之前,想要充当心理健康 AI 应用的守门人,其自身的科学性依然包裹在一层商业黑盒之中。

关键指标与真实业务坐标 5 人 团队全职规模 含两名姐弟联合创始人 100K+ 宣称交互规模 官网未标明单日或累积 Awardable 美防部平台采购资格 非正式落地采购合同

巨头的盲区与医学的分裂

初创公司的生存裂缝,本质上是头部科技大厂战略撤退留下的产物。OpenAI 在 2026 年 9 月 23 日联合 22 个国家的 80 多位心理学专家,高调发布了包含 1,215 组对话的评测基准 MentalHealthBench。但翻开其白皮书,最致命的一行小字赫然在目:这项基准明确将拟人化 AI 伴侣与情感依附排除在测试范围之外。

大厂的算盘十分精明:情感陪伴是黏性与日活的源泉,也是法律诉讼与伦理索赔的火药桶。既然单次单步的问答容易约束,那就只测固定场景下的下一步回答,把深不见底的多轮拟人互动留给未知的旷野。

规避了移情评测的安全基准,只是厂商自我安慰的纸质防弹衣。

学术界的最新发现更让自动化测试的底层逻辑受到严峻拷问。2026 年 6 月公布的情感支持评测基准 EMPATH,针对跨语种机器人设计了 34 种角色和 19 项指标。研究得出的残酷结论是:大模型评测在多轮交互中存在剧烈的跨轮次波动,甚至连受邀参与自杀与自残风险标注的执业精神科医生之间,都存在极其严重的分歧。

  • 结论.医学界至今无法对一段暧昧的对话是否构成自残诱导达成绝对共识,任何自动化测试开出的无偏差评分,在真正的医学与法律审视下都显得轻浮。

《韩非子》有云:“释规而任巧,释法而任智,惑乱之道也。”把危及性命的心理安全寄托于黑盒对抗,不仅救赎不了心智未成熟的青少年,反而给了整个产业一张逃避责任的合规贴纸。当模型越来越擅长扮演人类的心灵寄托,真正的安全解法绝非几组测试脚本所能交付;如果对拟人化诱导的商业贪婪不加钳制,再逼真的虚拟假人,也撞不碎现实中悲剧反复上演的高墙。