Holo4:赋能通用计算机操作代理
摘要
Hcompany 发布 Holo4,一系列用于通用计算机使用的代理AI模型,提供27B和35B-A3B两种规格,在与前沿模型的基准测试中表现良好。
查看缓存全文
缓存时间: 2026/09/28 15:25
Holo4:驱动通用计算机操作智能体
来源:https://huggingface.co/blog/Hcompany/holo4 Holo4基准测试运行在Web应用、桌面软件和移动设备上的屏幕截图集合。(https://assets.hcompanyprod.fr/holo4/hf/holo4-cover.jpg)
Holo4是我们全新的智能体模型系列。它提供两种规格:27B稠密模型和35B-A3B混合专家模型。两者均已上线H Models API。我们还同步发布了更新版的Holotron 3:Holotron4 Nano。
Holo4基于我们此前的模型构建,能够通过任何可用界面与软件交互:图形界面、代码、MCP协议及API。它在学术基准测试中表现优异,但我们设计的初衷是服务真实业务流程。该模型通过监督学习和强化学习,在涵盖我们智能体任务工厂生成的大量环境与任务中进行训练。
立即开始使用:
- 🤖**模型:**Holo4-27B (https://huggingface.co/Hcompany/Holo4-27B) | Holo4-35B-A3B (https://huggingface.co/Hcompany/Holo4-35B-A3B) | Holotron4 Nano (https://huggingface.co/Hcompany/Holotron4-30B-A3B)
- 🗂️**完整集合(FP16, FP8, GGUF):**Holo4 (https://huggingface.co/collections/Hcompany/holo4)
- 🎞️**操作轨迹:**查看器 (https://trajectories.hcompany.ai/) | 数据集 (https://huggingface.co/datasets/Hcompany/trajectories)
- ⚡**H Models API:**快速入门 (https://hub.hcompany.ai/models-api/quickstart)
- 📝**完整博文:**hcompany.ai/newsroom/holo4 (https://hcompany.ai/newsroom/holo4)
https://huggingface.co/blog/Hcompany/holo4#models-built-for-every-interface为所有交互界面而生的模型
Holo4能在屏幕上点击和输入,编写并运行自己的代码,调用MCP协议或API工具。它会根据任务需求灵活选择最合适的交互方式。大多数智能体模型仅针对单一界面训练:专注于图形界面的模型在无屏幕环境下便束手无策,而偏好工具调用的模型则在没有API的应用程序前无计可施。实际工作并非如此割裂,单个业务任务往往需要结合多种交互方式。
Holo4可在桌面端、网页端、Android系统、代码沙箱环境中运行,也能对接企业API。无论在哪种场景下,它都是同一个模型,调用方式完全相同。你无需为不同平台选择不同的模型。
Holo4基准测试结果及任务成本对比(与Qwen3.8 27B和前沿模型比较)(https://assets.hcompanyprod.fr/holo4/hf/holo4-benchmark-table.png)
Holo4模型相比其基础模型Qwen取得了显著提升。在复杂工作流任务中,Holo4仅略逊于最强闭源模型:在OSWorld 2.0测试中,Holo4 27B得分61.7%,而Opus 5.5得分为81.8%,Holo4 35B-A3B得分30.9%。然而,Holo4使用的参数量要少几个数量级,成本也低得多。我们在公共基准测试中公开了所有操作轨迹:可在trajectories.hcompany.ai (https://trajectories.hcompany.ai/)回放每一步操作,或从Hugging Face (https://huggingface.co/datasets/Hcompany/trajectories)下载。
https://huggingface.co/blog/Hcompany/holo4#competitive-with-the-frontier-at-a-fraction-of-the-cost以极低成本比肩前沿模型
在桌面控制(OSWorld 2.0)和API使用(AutomationBench)等最具挑战性的学术基准测试中,Holo4以更低的任务成本与前沿模型同台竞技。
OSWorld 2.0:平均部分得分与任务成本对比 (https://assets.hcompanyprod.fr/holo4/hf/holo4-cost-osworld2.png)
AutomationBench:得分与任务成本对比 (https://assets.hcompanyprod.fr/holo4/hf/holo4-cost-automationbench.png)
成本性能图表说明 OSWorld 2.0。 成本根据每次智能体运行的输入和输出token数估算。Holo4按H Models API费率(单次运行)计价。Qwen3.8 27B:模型卡片得分,成本按阿里云标价和我们运行使用的token数计算。Qwen3.6 35B-A3B:我们在测试框架中的单次运行成本,按阿里云标价计算,其中缓存命中部分按输入价格的20%计费。OpenAI发布数据提供了GPT和Opus系列在不同算力下的曲线;其他闭源和开源权重模型的点位数据来自OSWorld 2.0官方排行榜 (https://osworld-v2.xlang.ai/)。各模型的发布版本、运行框架和任务子集存在差异。折线连接了闭源模型中非支配得分与成本的点对;Holo4被排除在外。
AutomationBench。 Holo4、Qwen3.8 27B和Qwen3.6 35B-A3B:使用AutomationBench v1.0.6版本,得分和成本在我们内部测试框架中测量。其他模型:得分来自AutomationBench README (https://github.com/zapier/AutomationBench)中的公开测试集结果,任务成本来自官方排行榜 (https://zapier.com/benchmarks)(使用私有测试集运行)。待评估完成后,我们将报告Holo4在私有测试集上的表现。
https://huggingface.co/blog/Hcompany/holo4#ai-that-does-work能干活的AI
Holo4模型基于我们智能体任务工厂的环境和任务进行训练,在专业软件操作上表现出色。以下示例展示了Holo4 27B与其基础模型Qwen3.8 27B的对比。两个模型使用相同的提示词和测试框架。
https://huggingface.co/blog/Hcompany/holo4#3d-modeling-%C2%B7-eiffel-tower3D建模 · 埃菲尔铁塔
在FreeCAD中构建埃菲尔铁塔的3D模型,比例尺为1毫米对应1米,以原点为中心并对齐X轴和Y轴。请按照以下设计要求操作。铁塔在任意高度的平面投影均为方形,从不呈圆形。其中心轴到外角的半宽尺寸如下:地面层为62.5毫米,57米高度处为32.5毫米,115米高度处为17.5毫米,276米高度处为9.35毫米。在这些高度之间,半宽遵循一条平滑曲线:在靠近地面处急剧下降,在高处平缓延伸,绝不使用直线。四条完全相同的腿,每个象限一条,每条都是方形柱体,其外角遵循上述轮廓。每条腿在地面处宽14毫米,在276米高度处逐渐收窄至4毫米。这些腿从地面延伸至第一层平台时彼此分开,随着高度增加逐渐靠拢。它们之间的空间是空的:铁塔是中空的,从任何一侧都能直接看穿。三层平台,每层都是以中心轴为中心的实心方板:57米高度处宽72毫米、厚4毫米;115米高度处宽40毫米、厚3毫米;276米高度处宽22毫米、厚3毫米。从276米至324米处有一根桅杆,呈方形,底部宽8毫米,顶端逐渐收窄至2毫米。每个部件都必须是体积非零的闭合实体,且任何部件都不得填充腿部之间的空间。
Holo4 27B(84次调用,130万token) Qwen3.8 27B(60次调用,100万token)
https://huggingface.co/blog/Hcompany/holo4#3d-modeling-%C2%B7-h-logo3D建模 · H公司标志
在FreeCAD中构建H公司标志的3D模型:一个实心填充圆盘旁放置一个块状无衬线大写字母H,两者被挤出到相同厚度,两个形状高度相近且分开摆放以免重叠,圆盘中心与H的中部对齐。将两个形状都着色为黑色。
Holo4 27B(94次调用,150万token) Qwen3.8 27B(118次调用,190万token)
https://huggingface.co/blog/Hcompany/holo4#game-design-%C2%B7-pac-man游戏设计 · 吃豆人
在Godot引擎中构建一个类似吃豆人的游戏并保持运行。使用墙壁构建网格状的矩形迷宫,所有开放走廊中充满豆子。玩家标记沿走廊连续移动,吃掉经过的每个豆子并获得一分。三个幽灵在相同走廊中移动并追逐玩家。如果玩家被幽灵抓住,玩家失去一条命,所有元素重置到初始位置。屏幕显示得分和生命值。无人会真正玩这个游戏。玩家由简单启发式算法自动驱动:在每个路口,它会朝最近的豆子移动,除非有幽灵靠近,此时则远离幽灵移动。游戏必须能无人值守地无限运行,完全不需要键盘输入。当游戏能正常运行后,启动游戏并保持其播放状态。
Holo4 27B(68次调用,240万token,268行代码) Qwen3.8 27B(197次调用,1140万token,327行代码)
https://huggingface.co/blog/Hcompany/holo4#how-we-built-holo4我们如何构建Holo4
https://huggingface.co/blog/Hcompany/holo4#agentic-task-factory智能体任务工厂
我们内部的智能体流程集能够仅凭文档(如真实网站截图或开源软件)构建交互式环境和可验证的任务。目前,该工厂已生成约10,000个任务,涵盖Web应用、MCP服务器和桌面环境,包括通过图形界面和MCP暴露相同状态的混合环境。
智能体任务工厂:数据源、构建、门控、运行时与输出 (https://assets.hcompanyprod.fr/holo4/hf/holo4-task-factory.png)
https://huggingface.co/blog/Hcompany/holo4#training训练
Holo4训练:在1270亿token上进行监督微调,两位强化学习专家,一个合并模型 (https://assets.hcompanyprod.fr/holo4/hf/holo4-training.png)
https://huggingface.co/blog/Hcompany/holo4#harness测试框架
在训练的同时,我们重建了测试框架——这个循环负责执行模型操作并在数百个步骤中管理其上下文。重建工作借鉴了在OSWorld 2.0上进行智能体性能测试的反馈。智能体会标注每个任务失败的原因,工程师则审查并修复问题。最大的改进是为智能体提供了一个可靠的内存系统(可跟踪数百个步骤)以及桌面机器本身的shell环境。
自动化测试框架工程:每次评估运行在OSWorld 2.0上的得分随时间变化 (https://assets.hcompanyprod.fr/holo4/hf/holo4-harness-history.png)
Opus 5 (70.2%) 和 GPT-5.6 Sol (66.2%) 使用了来自OpenAI发布图表 (https://openai.com/index/introducing-gpt-6-sol-and-luna/) 的v2026.08.08离线集上的最大算力部分奖励,如同成本性能图所示。其他参考分数来自模型卡片和官方排行榜。各模型的任务版本、测试集和运行框架存在差异。
https://huggingface.co/blog/Hcompany/holo4#holotron4-nanoHolotron4 Nano
我们的后训练栈旨在适配新的基础模型,并生成能够跨界面和环境泛化的智能体。作为NVIDIA Nemotron联盟 (https://hcompany.ai/newsroom/h-joins-nemotron-coalition) 的一员,我们将最新的技术栈应用于Nemotron 3 Nano Omni模型,作为Holotron 3的后续版本。
相同的方法将Nemotron 3 Nano Omni转化为Holotron4 Nano,一个通用的智能体模型,在图形界面工作流以及暴露MCP、API或代码沙箱的环境中,相比基础模型有显著提升。
Holotron4 Nano与Nemotron 3 Nano Omni在五项基准测试中的对比 (https://assets.hcompanyprod.fr/holo4/hf/holotron4-benchmarks.png)
增益是相对于Nemotron 3 Nano Omni的绝对百分点提升。
这些提升表明我们的方法具有良好迁移性,能够将通用模型转变为智能体专家。其中没有任何技术是针对特定模型规模设计的。
https://huggingface.co/blog/Hcompany/holo4#run-it-yourself自行运行
两种规格的模型现已登陆H Models API (https://hub.hcompany.ai/models-api/introduction)。权重已在Hugging Face (https://huggingface.co/collections/Hcompany/holo4)发布,提供BF16、FP8、NVFP4和4-bit GGUF格式,与我们的小模型Holotron4 Nano (https://huggingface.co/Hcompany/Holotron4-30B-A3B)并列。
我们将在未来几天内发布优化的DSpark草稿模型检查点,以进一步加速推理。
相似文章
@hcompany_ai: 今天我们发布Holo4,我们全新的通用计算机操作模型家族。Holo4能够点击、编码并调用工具……
H公司发布了Holo4,这是一系列通用AI模型,能够执行涵盖桌面、网络、Android和API的计算机操作任务,例如点击、编码和调用工具,并通过H Models API提供商业使用。
Holo4
H公司已发布两款视觉语言模型,Holo4-27B-GGUF和Holo4-35B-A3B-GGUF,专为计算机使用自动化而设计。这些模型基于Qwen架构构建,配合hai-agents harness执行点击、输入和代码等任务。
Holotron-12B - 高吞吐量计算机使用智能体
H 公司发布 Holotron-12B,一款采用混合 SSM 架构、针对高吞吐量推理优化的多模态计算机使用智能体。该模型基于 NVIDIA Nemotron 进行后训练,在交互式智能体工作负载中展现出卓越的效率与可扩展性。
Holo3.1:快速本地计算机使用智能体
Holo3.1 是一个更新的计算机使用模型系列,提升了在网页、桌面和移动环境中的鲁棒性,引入了用于本地执行的量化检查点,并增加了对函数调用协议的原生支持。
Holo3.1 35B/9B/4B/0.8B (Qwen 3.5微调版)
H Company发布Holo3.1,这是一个面向计算机使用代理的视觉语言模型系列(0.8B至35B),支持Web、桌面和移动端自动化,具备原生函数调用功能,并提供优化后的量化检查点,便于本地部署。