Anthropic 披露的用户绕过护栏事件,在科技界引发了对生物武器滥用的新一轮恐慌。但这并非外界想象中黑客通过神秘字符击穿了底层模型,而是攻击者披着合法学术外衣,在现存规则边缘完成的系统性渗透。
当生命科学的高级推理能力被封装进对话框,大模型安全防御正撞上一堵无法绕开的技术死墙:制造疫苗与制造武器在分子层面上几乎完全同构。纯文本分类器的严防死守,正在变成一道既容易被灰产中继绕过、又严重误伤正规科研的脆弱防线。
正痘病毒方案在 1 小时内成型:被学术外衣穿透的分类器
根据 Anthropic 2026年9月发布的威胁情报报告,其系统在2025年12月至2026年8月间共检测到 5 起真实生物滥用或双重用途研究。这些案例并非理论探讨,而是具体覆盖了基孔肯雅热、哺乳动物适应性高致病性禽流感、正痘病毒、蛇毒肽设计以及计算毒素重组等高危领域。
最典型的一幕发生在正痘病毒案例中。一个挂靠在美国代理网络、服务十余家客户的转售中继,在数天内向 Claude 倾泻了数万条调用消息。其中一名终端用户利用 Opus 5 在约 1 小时内起草了一份端到端的免疫逃逸研究方案。
整个交互过程中,分类器始终处于静默状态。原因在于该方案被全程包装为减毒活疫苗研发与受体结合机制的民用探索。在长程分子推理上,模型展现出了极高的专业度,但在意图辨别上,它无法区分一段氨基酸序列的改造究竟是为了阻断流行病,还是为了让病原体逃避人体免疫屏障。
这种隐蔽性在为期 30 天的专项活动审查中体现得尤为明显。Anthropic 发现受限区域关联机构发起的约 35 个独立科研项目中,绝大多数属于常规民用研究,但部分课题却与军民两用病原体高度重叠。
在基孔肯雅热与禽流感案例里,研究人员并没有调用处在最高风险梯队的 Fable 或 Mythos 级模型,而是将庞大的科研工程拆解为成百上千个微小提问,分散交由弱一些的 Sonnet 4 与 Haiku 4.5 协助处理。这类事务性文献整理与基础计算,根本不会触发任何警报。
- 风险.当攻击逻辑与正规科研范式完全重合,基于单次 Prompt 的内容拦截事实上已经丧失辨识度。
灰产中继与模型套利:单一厂商护栏为何沦为马奇诺防线
现实中最致命的安全漏洞,往往不发生在实验室内部,而发生在产业链的连接处。这批被披露的规避操作,已经展现出高度工程化的跨平台套利特征。
灰色中继商利用美国境内的代理节点穿透地域准入封锁,同时向终端用户提供零数据留存(ZDR)服务以对抗事后审计追溯。更具讽刺意味的是,当部分高危提问被 Claude 拒答后,这套代理中间件会依据规则引擎,将相同提示词自动重定向至审核相对宽松的竞品模型继续生成,甚至有攻击者诱导 Claude 自行为其编写跨平台分流的路由脚本。
各头部实验室之间显著的安全水位差,让单一厂商严密的防御体系迅速被架空。
在 SecureBio 发布的权威 BioTIER 评测中,Claude Opus 4.8 [max] 综合分为 95.3%,高危拒绝率达到 95.8%;Opus 5 [max] 综合分为 94.3%,高危拒绝率同样保持在 95.0% 的极高区间。作为对照,Gemini 3.1 Pro preview 虽然守住了 100.0% 的良性学术接受率,但其高危拒绝率仅为 68.1%,综合评分为 81.0%。
在行业横向竞争中,Anthropic 筑起了最高的防御栅栏,其早期针对 Claude Opus 4 的生物武器规划试验测得能力提升倍数为 2.53 倍,低于 2.8 倍的 ASL-3 阈值,但其长程病毒学任务得分已高达 0.912 pass@5,明显越过了 0.8 的自动化评估红线。
竞品同样面临巨大考验。OpenAI 在 GPT-5 发布前动用了超过 400 名外部专家、经历了累计超 5000 小时的红队测试,最终仍将 gpt-5-thinking 定为生物化学高风险级别;Google DeepMind 则在 2026 年 4 月 17 日紧急将其前沿安全框架更新至 3.1 版,重点锁死物理防泄漏与安全用例审批。
然而,只要行业内存在防御洼地,恶意使用者就能把最严苛的平台当成跳板,用路由脚本把敏感任务派发给其他竞品完成拼装。
误杀的代价与特种准入:语义拦截正退回实名 KYC
极高的拦截率并非没有代价,它直接激化了安全管控与合法科研之间的矛盾。
为了死守安全线,Anthropic 曾一度对生命科学领域采取宁杀错不放过的激进策略。过载的敏感词拦截导致正常学术提问被大面积强制降级回退。由于反弹剧烈,Anthropic 不得不在 2026 年 8 月 7 日紧急更新 Fable 5 护栏,将生物相关的降级回退减少了约 85%,并将 Claude.ai 总体回退减少约 67%、Cowork 减少 55%、Claude Code 减少 17%、Platform 减少 7%。
这种大幅回调清晰暴露出纯文本拦截机制的苍白。如果分类器收得太紧,合法药企和病毒学家的研究就会寸步难行;如果放得太宽,恶意分子就能利用减毒包装在 1 小时内拿到免疫逃逸方案。
决定生物威胁走向的不是模型答不答那句话,而是现实实验室里谁拿到了试剂与序列合成权限。
仅停留在生成界面的阻击战已经触碰天花板。大模型的生物防御正在告别廉价的词表与输入过滤,被迫转向更加沉重、也更具行政成本的特种监管路径。
- 结论.单纯依靠提示词对抗已无意义,前沿大模型的生命科学能力必将全面引入机构实名认证(KYC)、严格的可信研究员准入(Trusted Access)以及全链路审计。
