GitHub开源项目JoasASantos/Offensive-Security-AI-Models最近整理了一份无审查及网络安全微调模型清单,展示了包括参数量达180B的CYBER-FROST-3.8、经由1.7M条样本微调的DeepHat V2,以及专门针对漏洞利用的BugTraceAI-CORE-Apex在内的多款模型,并附带了一张名为offsec-benchmark-v3的跑分图表。
在主流商业模型因对齐策略对攻击指令严防死守的当下,这份清单迅速被不少安全圈从业者奉为开源武器库。但若剥开参数规格与跑分图表的外衣,这更像是一场将解除拒答限制误当作攻防能力跃迁的技术虚火。
清单包装下的跑分空转:一张图片撑不起的基准测试
该项目的本质只是一份人工整理的规格汇总,其README文件中并未公开任何关于v3基准的测试方法论、测试提示词集、逐项打分明细或具体评估日期。所谓的对比测试,最终仅仅落在一张名为offsec-capability-v3.png的独立图片文件上。
清单中列出的模型看似阵容齐整:DeepHat V2宣称喂入了来自安全会议工作坊的1.7M条样本;BugTraceAI-CORE-Apex宣称融合了近年HackerOne的真实漏洞报告;BugTraceAI-CORE-Ultra则用2,541条漏洞利用数据主攻渗透脚本编写。然而,在缺乏受控实验环境与可验证脚本的情况下,这种只公布模型卡片参数却隐藏评测代码的做法,属于典型的有清单无跑分。
社区开发者下载这些模型后很快发现,很多微调模型面对特定漏洞场景时生成的代码,依然只是对历史公开CVE利用代码的机械拼凑。当用户需要模型理解稍有偏差的目标上下文时,代码就会迅速陷入无法执行的幻觉状态。
移除了道德限制仅代表模型不再拒绝作答,绝不等于它学会了攻防推理。
拒答率降低并非能力跃迁:Meta实测戳破的实战假象
安全社区的多项实测反馈印证了一个技术现实:开源无审查攻防模型最显著的变化在于拒绝率降低,而非进攻逻辑与代码推理能力的实质突破。面对安全提示词,模型不再输出合规性拒绝模板,开始顺从地吐出长串攻击脚本,但这并不意味着这些脚本可以直接打穿目标系统。
在实际执行中,决定一次任务成功与否的关键往往不在于基座模型微调了多少万条文本,而在于其量化等级、Agent脚手架(Scaffold)、系统提示词引导以及外部工具定义的精准度。微调往往只改变了模型的输出概率分布,却没有提高它在长链决策中纠错的能力。
学术界与头部机构的严谨对照实验直接证明了这种局限。Meta在2024年7月发布的CyberSecEval 3评测中,安排了62人参与Hack The Box红队任务实测。结果显示,即便是面对参数量高达405B的顶级模型,它相比研究人员使用传统搜索引擎并未展现出统计学上显著的进攻能力增益。特别是在Windows虚拟机自主攻击场景下,模型在漏洞利用与维持权限两个核心阶段依然步履维艰。
即便在防守侧的钓鱼能力评估中,CyberSecEval 3的局限同样明显:其评测重度依赖LLM自身充当裁判,而其实验里用于基准校准的人工标注样本仅包含4名评估员与10个测试用例。这种评估机制的单薄,折射出整个网络安全领域在衡量大模型真实攻防能力时的尺度混乱。
离开无菌沙箱的代价:真实网络环境容不下纸上谈兵
民间榜单与工业实战的脱节,根源在于评测标准被混淆了概念。业界存在两个完全不同维度的SecBench项目:其中一个包含44,823道单选与3,087道简答,中文题目占比分别高达80.4%和97.4%,其打分完全依赖GPT-4o-mini判定模型掌握的概念;而NeurIPS 2025提出的SEC-bench,则是依托Docker沙箱对真实CVE漏洞进行PoC生成与补丁修复的动态Agent评测。
拿着选择题高分来标榜实战水平,是目前攻防模型最常见的包装手段。一线安全专家早已指出,这类纯静态测试集完全脱离了真实的生态效度。真实世界的渗透测试从不发生在标准提示词构筑的无菌沙箱里,目标资产往往夹杂着庞杂的脏日志、鉴权随时失效的接口、工具报错抛出的异常栈,以及防御设备施加的动态流量拦截。
- 风险.红队人员若盲目依赖未经沙箱验证的无审查模型编写利用链,将付出极高的代码排错与幻觉验证成本;而企业SOC团队若误判外部威胁,将预算过度倾斜于防范AI全自主黑客,反而会忽视自动化脚本扫描与基础补丁落地的真正防线。
脱离了多步规划、环境容错与动态工具交互的工程脚手架,参数规模再大、去审查再彻底的模型,也终究只能在无干扰环境下充当低阶的语法补全助手。大模型在网络安全攻防中的进化,不在于又洗掉了多少层对齐词表,而在于谁能率先在充满噪声与对抗的动态沙箱里完成真正闭环的长程推理。
