@TeksEdge:哇!全新开源计算机使用模型在单个 DGX Spark 上于 LLM 排行榜展现强劲本地性能!这…

X AI KOLs Timeline 模型

摘要

H 公司发布了 Holo-3.1-35B-A3B-NVFP4,一款开源计算机使用模型,在单个 DGX Spark 节点上可实现每秒高达 195 个 token 的推理速度,性能超越 Qwen3.5-397B 和 Kimi-K2.5 等更大模型。

哇!全新开源计算机使用模型在单个 DGX Spark 上于 LLM 排行榜展现强劲本地性能! 该模型可快速处理你的智能体的计算机使用工作负载! Holo-3.1-35B-A3B-NVFP4(vLLM + NVFP4) » 低并发下 101 token/秒 » 高并发(c10)下可扩展至约 195 token/秒 一款 35B 级模型在单个 DGX Spark 节点上为计算机使用场景实现近每秒 200 个 token 的推理速度,令人印象深刻。对于本地智能体模型而言,效率极高。 不知道 Mac/StrixHalo/RTX 显卡的表现会如何?
查看原文
查看缓存全文

缓存时间: 2026/06/03 17:53

哇!新的开源 Computer Use 模型在 LLM 排行榜上表现出色,仅用单台 DGX Spark 就能实现强大的本地性能!

这款模型能快速处理你的智能体的 Computer Use 工作负载!

Holo-3.1-35B-A3B-NVFP4(vLLM + NVFP4)

» 低并发下 101 tokens/秒 » 高并发(c10)下可扩展至约 195 tokens/秒

一个 35B 级别的模型,在单台 DGX Spark 节点上为 Computer Use 实现了近 200 tokens/秒的速度,令人印象深刻。对于本地智能体模型来说,效率极高。

不知道 Mac / StrixHalo / RTX 显卡表现会如何?

David Hendrickson(@TeksEdge): 🌞这可是本地 AI 的重大新闻!一款新的开源 Computer-Use LLM 刚刚发布。

Holo 3.1 是 H 公司(🇫🇷)的新款本地计算机使用智能体模型,性能超越了 Qwen3.5-397B、Kimi-K2.5 和 Sonnet 4.6!

由于它专为本地部署而设计 → ⬩ 可完全在你的机器上运行

相似文章

DGX Sparks与新模型:我的测试与结果

Reddit r/LocalLLaMA

本文介绍了在NVIDIA DGX Sparks硬件上测试DeepSeek V4 Flash和Qwen3.8等AI模型的结果,详细说明了性能指标、上下文长度、基准分数以及操作见解。

DGX Spark 智能体使用数据

Reddit r/LocalLLaMA

一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。