H Company 在 2026 年 9 月 28 日宣布推出全能型计算机操作智能体 Holo4 系列,包含 27B Dense、35B-A3B MoE 两个主力尺寸,以及端侧轻量版本 Holotron4 Nano。与过去两面割裂的自动化工具不同,研发团队宣称 Holo4 打通了图形界面(GUI)、代码沙箱、MCP(Model Context Protocol)以及 REST API,旨在用单一模型调度所有企业软件。

这篇宣发看似拿出了击穿行业成本的杀手锏,但将材料放在公开事实与技术账本下审视,核心判断截然不同:这更像是一次口径存疑的超前宣发。小参数模型在宣称的跑分上逼近闭源巨头,却掩盖了基准版本更迭带来的数据错位;全接口统一的代价,则是长任务中暴增的 Token 消耗与状态回滚陷阱。

查无实据的 61.7% 与消失的模型权重

翻开官方宣发,最引人注目的莫过于基准战报:Holo4 27B 在桌面操作权威基准 OSWorld 2.0 上取得了 61.7% 的得分,直逼顶尖闭源模型 Opus 5.5 的 81.8%,而 MoE 架构的 35B-A3B 取得 30.9%。团队强调,这一代模型基于 Qwen3.8 27B 和 Qwen3.6 35B-A3B 基座,借助自研的数据工厂与强化学习训练完成,具备极高的单位成本优势。

但核查公开记录会发现明显的断层。截至 2026 年 9 月 28 日,在公开索引渠道中,尚未检索到 H Company 官方正式上架的 Holo4-27B 与 Holo4-35B-A3B 权重或独立上线公告。官方此前公开的最新版本,仍停留在 2026 年 6 月 1 日发布的 Holo3.1,当时覆盖了 0.8B、4B、9B 及 35B-A3B 尺寸,产品线中根本没有 27B。

OSWorld 基准成绩与官方记录口径对照 Holo3.1 官方发布历史 发布时间:2026 年 6 月 1 日 涵盖规格:0.8B / 4B / 9B / 35B-A3B OSWorld 历史得分:BF16 80.0% 授权协议:Apache 2.0 开源许可 Holo4 宣发疑点核查 宣称成绩:OSWorld 2.0 取得 61.7% 官方榜单:未见 61.7% 提交记录 榜单交叉:61.7% 与 UI-Venus 跑分重合 权重现状:未见正式公开 Checkpoint

更关键的分歧在跑分口径上。OSWorld 2.0 于 2026 年 6 月 26 日正式发布,但在其官方排行榜上,并没有检索到 Holo4 获得 61.7% 的提交记录。耐人寻味的是,61.7% 这个精确数字,在基准测试中恰好出现在另一家开源模型 UI-Venus 的跑分表里。

与此同时,上一代 Holo3.1 在官方环境下报告的 OSWorld 跑分曾高达 BF16 80.0%(FP8/NVFP4 格式为 77.8%)。从旧版测试的 80.0% 到新版 2.0 的 61.7%,表面上模型换代导致数字回落,实质是测试集难度经历了断层级跃迁。这种未列入官方主榜、且与第三方数字高度重合的跑分,无论属于内部灰度测试还是提前抢跑,都在可信度上打上了问号。

统揽一切接口的工程代价

长久以来,自动化软件操作被困在两个极端之间。一类是专注图像识别的视觉 Agent,必须依赖屏幕截屏和虚拟光标,遇到无界面的纯后台服务器就完全瘫痪;另一类是基于结构化函数调用的工具智能体,习惯了规范的 JSON 参数,一旦丢给它一个没有 API 的老旧 ERP 客户端,系统就会立刻停摆。

Holo4 试图打通这种边界。它利用自动化流水线从开源软件和网站说明文档中抽取逻辑,合成了约 10,000 个横跨桌面、Web 和 MCP 协议的交互任务。

计算机操作智能体的架构统一演进 割裂形态:GUI 专精 截屏识图 / 键鼠拟人 遇无界面后台即失效 + 割裂形态:API 专精 函数调用 / JSON 协议 遇无 API 旧软件束手 Holo4 统一调度动作空间 GUI 点击 + Shell 脚本 MCP 协议 + REST API 统一底层环境与上下文管理

这种全能方案听起来解决了工具割裂,但在工程落地时,跨环境执行带来了巨大的稳定性挑战。为此研发团队重构了执行底座,给模型塞进长达数百步的状态上下文,并赋予本地操作系统的 Shell 执行权限。

宣发文章还引用了 AutomationBench 来证明其跨应用接口调用的优势。需要廓清的是,该测试集并非 H Company 的官方自建项目,而是自动化集成商 Zapier 提出的行业第三方评测。全接口支持的背后,是用极其庞杂的环境信息换取兼容性,这直接导向了企业级部署中最敏感的环节:算力账单。


埃菲尔铁塔背后的百万 Token 账本

小模型通常被赋予降低部署门槛的期待。参考 H Company 官方 API 对 Holo3.1 35B-A3B 设定的价格体系,输入每 100 万 Token 标价 0.25 美元,命中缓存时为 0.025 美元,输出每 100 万 Token 为 1.80 美元,免费层速率限制为 10 RPM。与顶尖闭源模型相比,表面费率确实低廉。

但当自动化操作进入真实工业软件,账面单价并不能直接转化为低成本。

单次任务的低费率优势,极易在数百次深度调用中被几何级消耗吞噬。

在官方给出的 FreeCAD 埃菲尔铁塔 3D 建模测试中,Holo4 27B 成功建立了符合几何参数的阶梯塔身与空心四脚立柱。这一项任务,Holo4 耗费了 84 次调用,产生高达 1.3M(130 万)Token 的上下文消耗;作为对比基准的 Qwen3.8 27B 调用了 60 次,消耗 100 万 Token。而在 Godot 引擎制作无玩家吃豆人游戏的任务中,Holo4 消耗了 2.4M Token,原版基座更飙升至 11.4M Token。

评估维度宣发主张(预期愿景)实测与工程现实(实际处境)
测试跑分OSWorld 2.0 取得 61.7%,逼近顶尖模型官方榜单无记录,与第三方重合,缺乏复现验证
单任务开销参数量小、API 费率远低于闭源大模型复杂建模单次消耗 130 万 Token,试错成本高企
可用性状态涵盖多规格并已开放 API 与权重获取截至发稿核心版本权重未上架,演进存在断层

这类桌面交互并非一次性问答。一旦模型在第 50 步由于界面延迟或视窗遮挡发生误点击,其后所有动作都会面临错误级联。为了维持纠错与状态追踪,系统只能不断把历史屏幕快照和操作流塞入输入端。即便单价便宜,一个单体任务吃掉上百万 Token 也意味着企业自动化并非零成本狂欢。

  • 风险.当智能体需要数十步交互才能闭环时,单价红利会被冗余调用与容错成本快速抵消。

对于试图采购低成本方案取代手工 RPA 的企业而言,决定选型的从来不是小模型跑分有多漂亮,而是任务的一次成功率与状态回滚容错率。若 Holo4 无法在公开环境中证明其轨迹的可复现性,企业级部署就很难盲目为这份百亿参数的降本故事埋单。接下来最值得跟踪的,不仅是 trajectories.hcompany.ai 上的运行轨迹能否经受验证,更是这组 27B 与 MoE 权重能否真正以开源形态兑现到开发者的本地终端中。