Tencent-HY3 在 128GB 上果然厉害!

Reddit r/LocalLLaMA 模型

摘要

用户分享了在 MacBook M5 Max 128GB 配置上运行腾讯新款 295B-A21B MoE 模型 HY3 的体验,相较于 DeepSeek v4 Flash,取得了令人印象深刻的性能和质量提升。

我对 HY3 印象深刻。如果你还没听说过这个模型,它是腾讯发布的一款新的 295B-A21B MoE 模型,直接与前沿的开源权重模型竞争,体积小得多,与 DeepSeek v4 Flash 相当但基准测试更好。我被这篇文章吸引了,而且我刚刚完成了我的 Macbook M5 Max 128GB 配置的更新,从 antirez 的 DeepSeek V4 Flash 量化版本(运行在 dwarfstar 上)换成了 Unsloth 的 IQ3_XXS(在主线的 llama.cpp 上)。我想如果我能让它跑起来,我就能有一个很好的比较基准,于是我开始研究,以下是我的发现。 首先,我得选一个量化版本。Hugging Face 上有几个,经过一番比较,我选定了这个 UD128("unsloth dynamic" 风格)107GB 的量化版本。它是当时我搜索时唯一一个公布了困惑度数值的版本,虽然那不是 KLD,但至少表明作者考虑了质量退化的问题。对于一个动态 3-bit 量化版本来说,困惑度看起来还不算太糟,而且感觉上和我之前用的 UD DS4 量化版本是类似的检查点。 接下来,我得让 llama.cpp 跑起来。量化版本的 readme 很有帮助地指出,PR #25395 同时实现了对这个模型及其内置推测解码模块的支持!快速编译一下就搞定了: git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp git fetch origin pull/25395/head:hy3 && git checkout hy3 cmake -B build -DGGML_METAL=ON -DGGML_METAL_EMBED_LIBRARY=ON cmake --build build --config Release -j 别忘了把 Mac 的 GPU 内存上限从默认的 96GB 调高!我设置为了 122GB,以确保测试时 24k 上下文能安全容纳(重启后会重置): sudo sysctl iogpu.wired_limit_mb=124928 然而,当我尝试运行模型时,llama.cpp 没有识别出它,服务器报错了。快速查看日志和量化版本的 readme 后,原因如下:"这些文件携带 general.architecture = hy-v3(这是此移植的原始命名)。PR #25395 将架构注册为 hy_v3(下划线)"。如果我当时更仔细一点,本可以避免这个麻烦,但我还是写了一个小脚本来替换那些字符(共 21 处,都在 3 个 GGUF 分片的第一个里面)。如果有人需要我可以分享,但说实话,直接让你的 agent 去做就行——修复 GGUF 只需要两分钟。 再次运行启动脚本,经过令人紧张的约 30 秒加载时间(从 SSD 读取 107GB)后,WebUI 弹了出来,我们开始运行了!基准测试(M5 Max,llama-bench,Metal,q8_0 KV 缓存,MTP 关闭): 测试 tokens/sec prefill pp512 @ empty ctx 528 decode tg128 @ empty ctx 32.4 prefill pp512 @ 16K ctx 124 decode tg128 @ 16K ctx 16.3 在实际使用中,token 生成速度是 \DOUBLE* 我从 DeepSeek 获得的速度,而且输出质量相同甚至更好!* 我甚至还没测试 MTP 看看是否有改善…… 这是我的 llama.cpp 启动命令: ~/llama.cpp-hy3/build/bin/llama-server \ -m ~/AI/models/Tencent-HY3-295B-A21B-YanissAmz/Hy3-UD128-00001-of-00003.gguf \ -a "Hy3 295B-A21B (UD128)" \ -ngl 99 \ -c 24576 \ -ctk q8_0 -ctv q8_0 \ -fa on \ -np 1 \ --jinja \ --temp 0.9 --top-p 1.0 \ --host 127.0.0.1 --port 8080 我只玩了几个小时这个模型,但它在普通提示和基本工具使用上的表现让我印象深刻。我一直在用它通过 HF MCP 和 CLI 工具进行 ML 研究,到目前为止它肯定比我之前的 DS4 设置更好——至少在氛围感和基本工具调用上是这样。我还没让它执行长期自主任务或具有挑战性的编码,所以很抱歉目前无法提供更深入的报告。这是我的启动命令: 我发这个帖子是因为我非常兴奋能在这个大小的检查点上有一个新的大的 MoE 可以玩,而且是一个非常 promising 的模型。希望它能激励其他一些人也试一试,并回馈他们的经验,或者比较其他量化版本/MLX 的性能。
查看原文

相似文章

DeepSeek-V4-Flash 284B 在 5.3GB 内存上运行

Reddit r/LocalLLaMA

一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。