Holo3.1:快速本地计算机使用智能体
Holo3.1: Fast & Local Computer Use Agents
Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 6.8 秒缩短至 3.3 秒。模型支持函数调用协议,可在第三方智能体框架中部署。
Holo3.1 把计算机使用代理从桌面扩展到了移动端,还首次放出了量化版,让本地运行真正快了起来。想做 GUI 自动化的开发者可以立刻跑起来了。
Maxime Langevin maxime-hcompany 关注
Hamza Benchekroun hamza-hcompany 关注
Emrick Sinitambirivoutin emricksini-h 关注
Antonio Loison antonioloison 关注
Avshalom Manevich avshalom-h 关注
Pierre-Louis Cedoz plcedoz38 关注
Aurélien Lac h-aurelien-lac 关注
去年三月,我们发布了 Holo3,这是我们当时最先进的计算机使用模型。它一经推出便被迅速采用。开发者、企业和合作伙伴开始将 Holo3 部署到各类工作流中,涵盖浏览器自动化、商业软件,以及内部工具和桌面应用。随着采用范围不断扩大,我们意识到仅靠性能已经不够。用户希望能在桌面和移动环境中运行同样的计算机使用能力,并与不同的智能体框架无缝集成。他们希望拥有部署灵活性,从云端推理到在终端用户设备上完全本地执行。
这正是我们发布 Holo3.1 系列的原因。Holo3.1 在三个对生产环境最为关键的维度上提升了稳健性:环境(Web、桌面、移动)、智能体框架和部署目标。我们首次发布了针对本地推理优化的量化检查点,包括 FP8、Q4 GGUF 和 NVFP4。
Holo3.1 是我们迈向通用计算机使用智能体愿景的重要一步:这类系统能够跨环境运行、集成到任何智能体技术栈中,并在工作流所在的任何地方运行。
跨 GUI 环境与智能体框架的计算机使用
Holo3.1 基于 Qwen 系列构建,旨在提升计算机使用智能体实际部署环境中的稳健性,同时保持最先进的性能。
当各团队将 Holo3 从评估推进到生产环境时,我们反复观察到同一个挑战:在一种场景下的强劲表现,未必能迁移到另一种场景。移动设备、不同的智能体框架以及不同的执行框架,都会各自引入分布偏移的来源。
移动端自动化
Holo3.1 将 Holo3 的能力从浏览器和桌面控制扩展到更广的范围,在移动端环境上带来大幅提升。在 AndroidWorld 上,我们的 35B-A3B 模型从 67% 提升到 79.3%,而更小的 4B 和 9B 变体则从 58% 提升到 72%。
跨框架性能
为了更好地支持在第三方智能体技术栈中部署 Holo 的团队,Holo3.1 在 Holo3 已有的结构化 JSON 输出之外,新增了对函数调用协议的原生支持。
在 OSWorld 以及我们覆盖电商、商业软件和协作工作流的内部基准套件上,函数调用与原生执行如今已达到接近持平的表现。在我们的 Holotab 产品框架内进行评估时,Holo3.1 相比 Holo3 还带来了超过 25% 的提升。
更小尺寸,实现成本与性能的权衡
为了进一步支持本地和端侧推理,我们还将发布新的模型尺寸,包括用于高性价比和私有化部署的小型模型(0.8B、4B 和 9B),以及用于实现最先进性能的更大 35B-A3B 模型。
Holo3.1 与 Qwen 3.5 系列的性价比对比。总体性能先对四项 H Corporate 基准取平均(因此每个系列权重相同),再对 OSWorld、AndroidWorld、H Corporate、ScreenSpot-Pro 和 OSWorld-G 取均值。
快速且本地化的推理
这是我们首次发布量化权重。我们从 35B-A3B 检查点开始,提供 FP8、Q4 GGUF 和 NVFP4 格式。
对于 NVFP4,我们使用了 NVIDIA 的 Model Optimizer,采用 W4A16 配置。这些检查点可为 Computer Use Agents 实现快速本地推理,且模型性能几乎没有下降。FP8 和 NVFP4 取得了相同的 OSWorld 分数,仅比全精度 BF16 检查点低约两分。
加速效果十分显著:在 DGX Spark 上,NVFP4 W4A16 的总 token 吞吐量是 FP8 的 1.41 倍,是 BF16 的 1.74 倍。
迈向消费级硬件上的本地智能体
我们还发布了 Q4 GGUF 检查点,旨在让 Computer Use Agents 能够在消费级硬件上本地部署。
智能体本身在 Windows 或 Mac 机器上本地运行,而模型既可以在同一台机器上运行——我们提供了 Apple Silicon 的参考数据——也可以在同一网络中的 DGX Spark 上运行。无论哪种情况,执行过程都完全私密且本地化,没有任何数据离开用户的网络。
在 Spark 上,我们与 NVIDIA 共同开发的智能体 harness 优化,结合上述 NVFP4 量化,相比 FP8 基线实现了约 2× 的端到端复合加速,将平均步进时间从 6.8s 缩短至 3.3s。
各平台与各精度下的智能体请求速率。在 DGX Spark 上,采用 NVFP4 的 vLLM 在 Default 和 Fast 两种模式下均实现了最高请求速率,其次是 Q4 GGUF 和 FP8。这些改进以及更多优化将落地于即将推出的桌面智能体 harness 中。
可用性
Holo3.1 系列提供四种规模:
| 模型 | 部署目标 |
|---|---|
| Holo3.1-0.8B | 超轻量本地智能体 |
| Holo3.1-4B | 高性价比部署 |
| Holo3.1-9B | 性能与延迟均衡 |
| Holo3.1-35B-A3B | SOTA 级性能 |
我们还发布了针对本地和边缘部署优化的 FP8、NVFP4 和 Q4 GGUF 检查点。
- Holo Models API:https://hcompany.ai/holo-models-api
- Hugging Face:https://huggingface.co/collections/Hcompany/holo31
我们期待看到开发者们用 Holo3.1 构建出什么。
来源:Hugging Face:Blog(RSS) · huggingface.co