Holo3.1:快速本地计算机使用智能体

Hugging Face Blog 模型

摘要

Holo3.1 是一个更新的计算机使用模型系列,提升了在网页、桌面和移动环境中的鲁棒性,引入了用于本地执行的量化检查点,并增加了对函数调用协议的原生支持。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:38

Holo3.1:快速且本地的计算机使用智能体

来源:https://huggingface.co/blog/Hcompany/holo31
返回文章列表 (https://huggingface.co/blog)

  • 移动端自动化 (https://huggingface.co/blog/Hcompany/holo31#mobile-automation)
  • 跨框架性能 (https://huggingface.co/blog/Hcompany/holo31#cross-harness-performance)
  • 面向成本-性能权衡的较小尺寸 (https://huggingface.co/blog/Hcompany/holo31#smaller-sizes-for-cost-performance-tradeoffs)
  • 迈向消费级硬件的本地智能体 (https://huggingface.co/blog/Hcompany/holo31#towards-local-agents-on-consumer-hardware)

今年三月,我们发布了 Holo3,这是我们最先进的计算机使用模型。采用速度非常快。开发者、企业和合作伙伴开始在广泛的流程中部署 Holo3,从浏览器自动化、商业软件到内部工具和桌面应用。随着采用率的增长,我们意识到仅凭性能已经不够了。

用户希望能够在桌面和移动环境中运行相同的计算机使用能力,并与不同的智能体框架无缝集成。他们希望部署灵活,既能用于云端推理,也能完全在终端设备上本地执行。

这就是我们发布 Holo3.1 系列的原因。Holo3.1 在生产中最关键的三个维度上提升了鲁棒性:环境(网页、桌面、移动端)、智能体框架和部署目标。我们首次发布了针对本地推理优化的量化检查点,包括 FP8、Q4 GGUF 和 NVFP4。

Holo3.1 是我们实现通用计算机使用智能体愿景的重要一步:能够跨环境运行、集成到任何智能体栈中、并能在工作流所在之处执行的系统。


https://huggingface.co/blog/Hcompany/holo31#computer-use-across-gui-environments-and-agent-harnesses 跨 GUI 环境与智能体框架的计算机使用

基于 Qwen 系列,Holo3.1 旨在提升鲁棒性,以适应计算机使用智能体实际部署的各类环境,同时保持最先进的性能。

随着团队将 Holo3 从评估转向生产,我们反复观察到同一个挑战:在一个设置中表现强劲并不能保证在其他设置中同样出色。移动设备、替代的智能体框架以及不同的执行框架都会引入各自的分布偏移。

Capture d’écran 2026-06-01 à 16.30.52 (https://cdn-uploads.huggingface.co/production/uploads/69ce2739f4b9146a31e99a2f/FZHF8oDkdWeMRSghXlO7h.png)

https://huggingface.co/blog/Hcompany/holo31#mobile-automation 移动端自动化

Holo3.1 将 Holo3 的能力扩展到浏览器和桌面控制之外,在移动环境上取得了重大进展。在 AndroidWorld 上,我们的 35B-A3B 模型从 67% 提升至 79.3%,而较小的 4B 和 9B 变体则从 58% 提升至 72%。

https://huggingface.co/blog/Hcompany/holo31#cross-harness-performance 跨框架性能

为了更好地支持在第三方智能体栈中部署 Holo 的团队,Holo3.1 引入了对函数调用协议的原生支持,此外还保留了 Holo3 已有的结构化 JSON 输出。

在 OSWorld 以及我们内部涵盖电子商务、商业软件和协作流程的基准测试套件上,函数调用和原生执行现在实现了近乎对等的性能。当在 Holotab 产品框架内评估时,Holo3.1 相比 Holo3 提升了超过 25%。

https://huggingface.co/blog/Hcompany/holo31#smaller-sizes-for-cost-performance-tradeoffs 面向成本-性能权衡的较小尺寸

为了进一步支持本地和设备端推理,除了用于最先进性能的 35B-A3B 大模型外,我们还发布了新的模型尺寸,包括用于经济高效且私有部署的小模型(0.8B、4B 和 9B)。

Capture d’écran 2026-06-01 à 16.21.18 (https://cdn-uploads.huggingface.co/production/uploads/69ce2739f4b9146a31e99a2f/RyP4nSDHYTtKv0eb3CjZI.png)

overall_pareto_light_notitle (https://cdn-uploads.huggingface.co/production/uploads/69ce2739f4b9146a31e99a2f/5voXQcpFKz6Fz3s3e4Kpu.png)

Holo3.1 和 Qwen 3.5 系列的性能与成本对比。总体性能先对四个 H Corporate 基准测试取平均(使每个系列权重相等),然后计算 OSWorld、AndroidWorld、H Corporate、ScreenSpot-Pro 和 OSWorld-G 的均值。


https://huggingface.co/blog/Hcompany/holo31#fast–local-inference 快速与本地推理

这是我们的首次发布携带量化权重。我们从 35B-A3B 检查点开始,提供 FP8、Q4 GGUF 和 NVFP4 版本。

对于 NVFP4,我们使用了 NVIDIA 的 Model Optimizer 进行 W4A16 配置。这些检查点使得计算机使用智能体的快速本地推理成为可能,且模型性能几乎没有下降。FP8 和 NVFP4 在 OSWorld 上取得了相同的分数,仅比全精度 BF16 检查点低约两个点。

加速效果显著:在 DGX Spark 上,NVFP4 W4A16 总 token 吞吐量是 FP8 的 1.41 倍,是 BF16 的 1.74 倍。

quality_throughput_pareto_light (1) (https://cdn-uploads.huggingface.co/production/uploads/69ce2739f4b9146a31e99a2f/LRDMlYHe5n_FLLu41CRXd.png)

https://huggingface.co/blog/Hcompany/holo31#towards-local-agents-on-consumer-hardware 迈向消费级硬件的本地智能体

我们还发布了 Q4 GGUF 检查点,旨在消费级硬件上本地部署计算机使用智能体。

智能体本身在 Windows 或 Mac 机器上本地运行,而模型可以在同一台机器上运行(我们提供了 Apple Silicon 的参考数据),也可以在同一个网络上的 DGX Spark 上运行。在这两种情况下,执行完全保持私密和本地化,不会离开用户的网络。

在 Spark 上,我们与 NVIDIA 共同开发的智能体框架优化,结合上述 NVFP4 量化,相比 FP8 基线实现了约 2 倍的端到端加速,将平均步骤时间从 6.8 秒降低到 3.3 秒。

agent_request_rate_light (https://cdn-uploads.huggingface.co/production/uploads/69ce2739f4b9146a31e99a2f/FbfYX69aNTL-U6yhOBQDN.png)

跨平台和精度的智能体请求率。在 DGX Spark 上,采用 NVFP4 的 vLLM 在默认模式和快速模式下均达到最高请求率,其次是 Q4 GGUF 和 FP8。这些改进及其他更多内容将很快在即将推出的桌面智能体框架中落地。


https://huggingface.co/blog/Hcompany/holo31#availability 可用性

Holo3.1 系列提供四种尺寸:

模型部署目标
Holo3.1-0.8B超轻量本地智能体
Holo3.1-4B经济高效部署
Holo3.1-9B性能和延迟平衡
Holo3.1-35B-A3B最先进性能

我们还发布了针对本地和边缘部署优化的 FP8、NVFP4 和 Q4 GGUF 检查点。


https://huggingface.co/blog/Hcompany/holo31#get-started 开始使用

  • Holo Models API:https://hcompany.ai/holo-models-api
  • Hugging Face:https://huggingface.co/collections/Hcompany/holo31

我们期待看到开发者用 Holo3.1 构建什么。

相似文章

Holo3.1 35B/9B/4B/0.8B (Qwen 3.5微调版)

Reddit r/LocalLLaMA

H Company发布Holo3.1,这是一个面向计算机使用代理的视觉语言模型系列(0.8B至35B),支持Web、桌面和移动端自动化,具备原生函数调用功能,并提供优化后的量化检查点,便于本地部署。

Holotron-12B - 高吞吐量计算机使用智能体

Hugging Face Blog

H 公司发布 Holotron-12B,一款采用混合 SSM 架构、针对高吞吐量推理优化的多模态计算机使用智能体。该模型基于 NVIDIA Nemotron 进行后训练,在交互式智能体工作负载中展现出卓越的效率与可扩展性。