@TeksEdge:哇!全新开源计算机使用模型在单个 DGX Spark 上于 LLM 排行榜展现强劲本地性能!这…
摘要
H 公司发布了 Holo-3.1-35B-A3B-NVFP4,一款开源计算机使用模型,在单个 DGX Spark 节点上可实现每秒高达 195 个 token 的推理速度,性能超越 Qwen3.5-397B 和 Kimi-K2.5 等更大模型。
查看缓存全文
缓存时间: 2026/06/03 17:53
哇!新的开源 Computer Use 模型在 LLM 排行榜上表现出色,仅用单台 DGX Spark 就能实现强大的本地性能!
这款模型能快速处理你的智能体的 Computer Use 工作负载!
Holo-3.1-35B-A3B-NVFP4(vLLM + NVFP4)
» 低并发下 101 tokens/秒 » 高并发(c10)下可扩展至约 195 tokens/秒
一个 35B 级别的模型,在单台 DGX Spark 节点上为 Computer Use 实现了近 200 tokens/秒的速度,令人印象深刻。对于本地智能体模型来说,效率极高。
不知道 Mac / StrixHalo / RTX 显卡表现会如何?
David Hendrickson(@TeksEdge): 🌞这可是本地 AI 的重大新闻!一款新的开源 Computer-Use LLM 刚刚发布。
Holo 3.1 是 H 公司(🇫🇷)的新款本地计算机使用智能体模型,性能超越了 Qwen3.5-397B、Kimi-K2.5 和 Sonnet 4.6!
由于它专为本地部署而设计 → ⬩ 可完全在你的机器上运行
相似文章
@TeksEdge: 这是本地AI大新闻!一款新的开源计算机使用大语言模型刚刚发布。Holo 3.1 是 H Company 的 () 新本地 c…
H Company 发布了 Holo 3.1,一个开源专为本地部署优化的计算机使用大语言模型,在 AndroidWorld 基准测试中达到 79.3%,超越了更大的模型如 Qwen3.5-397B 和 Kimi-K2.5。
DGX Sparks与新模型:我的测试与结果
本文介绍了在NVIDIA DGX Sparks硬件上测试DeepSeek V4 Flash和Qwen3.8等AI模型的结果,详细说明了性能指标、上下文长度、基准分数以及操作见解。
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。
@DeRonin_: 我目前的本机AI配置:- 2x DGX Spark 链接 (256gb) > GLM 5.2 @ 2bit, 推理 + 代理循环 - Mac Studio M3 Ultr…
一位用户描述了他们完全本地的AI堆栈,使用多个硬件设备运行GLM、Qwen和Kimi等中国模型,声称相比GPT-5.5和Opus 4.8等前沿模型节省了87%的成本,同时提到了自托管视频生成的计划。