网络安全攻防向来是前沿大模型最敏感的边界,通用模型为了防范恶意利用,通常在对齐阶段就掐断了深度漏洞挖掘的可能。OrcaRouter 在 2026 年 10 月 10 日上线面向安全垂直领域的 OrcaCyber Zero 1.5,试图用专有模型撕开这道口子。官方给出的数字极为扎眼:100 万 token 上下文窗口,外加 Cybench 基准测试 100% 的攻防成绩。

OrcaCyber Zero 1.5 核心规格与标称数据 1M 上下文窗口 (Tokens) 最大输出 128K 100% Cybench 跑分 无限制 Agent 执行 95.8% CVE-Bench 子集 可评估子集验证 $3 / $7.5 每百万 Token 定价 缓存读取 $0.75/M

压低价格与拉长窗口的商用规格

OrcaCyber Zero 1.5 标识为 orca/orcacyber-zero-1.5,除了 100 万 token 的输入窗口,最大输出长度达到 128K tokens,原生支持推理、函数调用和结构化输出。这一套组合直接瞄准了长代码库审计的痛点,试图把几万行代码直接塞进窗口做一次性扫描。

调用成本没有跟随版本号上涨。官方给出的 API 定价与此前的 Zero 1.0 完全持平:输入每百万 token 收取 3.00 美元,输出每百万 token 收取 7.50 美元,上下文缓存读取费用定在每百万 token 0.75 美元。对需要频繁批量跑代码静态分析的企业红队而言,这个单价确实具备价格吸引力。

这扇门目前只开了一条缝。模型没有向公众全面开放,而是被圈定在名为 Security Research tier 的安全研究层级内。使用者需要经过授权审核,仅对受信任的安全研究人员、企业红队及合规测试人员提供 OpenAI 兼容接口。

  • 建议.安全工程团队在将大段核心资产代码推入专有 API 前,必须确认数据保留协议,避免未经脱敏的内部系统拓扑进入第三方后训练池。

跑分神话背后的测试口径断层

官方公布的基准测试数据相当惊人。除了在无限制 Agent 执行条件下拿到的 Cybench 100% 满分,模型在 CVE-Bench 可评估子集达到 95.8%,SWE-bench Pro V2 拿下 76.5%,HumanEval+ 达到 93.9%。这些数字如果放在同一张成绩单上,足以压制所有通用前沿模型。

基准测试口径分歧:受控约束 vs 无限制执行 OrcaCyber Zero 1.5 口径 • Cybench 宣称:100% 通过率 • 执行条件:无限制 Agent 执行环境 • 变量控制:重试预算与工具调用不受限 • 厂商自报,缺乏第三方环境交叉验证 主流前沿基座口径 • Claude Opus 4.5:Cybench 82% (pass@1) • Claude Sonnet 4.5:55% pass@1 / 76.5% pass@10 • GPT-5.5-Cyber:SEC-Bench Pro 达 69.8% • 严格固定沙箱与单次运行开销预算

对比大厂公开指标就能看出评测口径的分歧。Anthropic 旗下的 Claude Opus 4.5 在 Cybench 固定子集测试里取得 82% 的 pass@1,Claude Sonnet 4.5 则是约 55% 的 pass@1 与 76.5% 的 pass@10。OpenAI 阵营中,GPT-5.5-Cyber 在 SEC-Bench Pro 上拿到 69.8%,即便具备授权访问的 GPT-6 Astra,在 ExploitBench 拿到 100% 的同时,其 ExploitGym 成绩也停留在 42.4%。

问题在于评估标准的差异。Orca 拿到满分的前提是无限制 Agent 执行,这意味着模型可以不断调用工具、尝试脚本并在试错中修正方向。前沿巨头的基准测试多数运行在受控的固定环境与有限预算内。没有置于相同的测试脚手架之下,这种横向跑分压制更多停留在纸面营销阶段。


隐匿的基座与未兑现的元数据

跑分口径可以推敲,模型本身的透明度则更显单薄。Orca 至今没有公布 Zero 1.5 的基座模型名称、参数量规模、预训练语料来源以及后训练所消耗的算力规模。上线初期,官方文档列出的公共元数据接口一度出现无法加载的状况。

盲信厂商自报跑分,往往是把实验室演示误当成了实战防御的铜墙铁壁。

这种黑盒状态让社区产生了分歧。Orca 此前发布 Zero 1.0 时,曾结合 DeepSeek V4 Flash 与自研 Harness 框架参与 CyberGym 评测。Zero 1.5 究竟是一次完全自研权重的垂直训练,还是针对既有开源大模型做的定向安全后训练二次封装,官方始终避而不谈。

在没有开源权重和技术报告的前提下,过度神化单点跑分并不明智。Cybench 本质上偏向夺旗赛形式的解题逻辑,CVE-Bench 检验的也是已知漏洞模式的验证。把已知题目的推演成功率,直接等同于在复杂生产环境中挖掘未知零日漏洞的能力,是安全领域最常见的认知错位。

攻防前线必须面对的现实损耗

100 万 token 确实为自动化安全审计提供了想象空间,但在实际工程中,上下文窗口往往逃不过推理衰减的物理法则。随着上下文长度向百万级推进,模型在跨文件污点分析和长链路指针追踪中的召回率通常会显著下滑。把一个大型代码仓库完整塞进上下文,模型能不能准确理清多层函数调用的信任边界,仍然需要独立的基准检验。

  • 风险.若将利用开发能力直接内置于低门槛接口中,自动化漏洞脚本生成的扩散成本将急剧降低,可能倒逼防御方的响应窗口被无限压缩。

荀子有言:“不登高山,不知天之高也;不临深溪,不知地之厚也。”跑分图表上的大满贯容易让人产生技术代差的错觉,但真实的红蓝对抗从不是封闭环境里的定式答题。在第三方机构给出严谨的复测结果之前,OrcaCyber Zero 1.5 带来的是一次低成本的长文本尝试,而非攻防力量的根本倾斜。接下来最关键的指标,依然是它在受限预算与严苛沙箱下,能否真正挖出那颗未经披露的隐藏漏洞。