llama-cpp

标签

Cards List
#llama-cpp

1x32GB V100 vs 2x16GB V100 vs 5060ti 16GB 运行Qwen 3.8性能对比

Reddit r/LocalLLaMA · 2026-08-30

用户考虑将5060ti 16GB升级为1x32GB V100或2x16GB V100,以在llama.cpp中运行Qwen 3.8模型时获得更好性能,并询问同价位其他选择。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA · 2026-08-30

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。

0 人收藏 0 人点赞
#llama-cpp

在128 GB M5 Max上运行Qwen3.8-Flash-Next(79 GB,2-bit)以350K上下文持续3.5小时——速度与上下文深度权衡,100轮对话,一张图表

Reddit r/LocalLLaMA · 2026-08-30

本文报告了在MacBook Pro M5 Max上运行Qwen3.8-Flash-Next模型的情况,对100轮对话中速度与上下文深度进行基准测试,并深入分析性能及长上下文下角色混淆等问题。

0 人收藏 0 人点赞
#llama-cpp

Nemotron-3.5-Lightning 以 11.77 GiB 出现,为该模型提供了首个 16 GB 选项

Reddit r/LocalLLaMA · 2026-08-29

ShimQuant 使得 Nemotron-3.5-Lightning 可以在 16 GB GPU 上运行,使用 11.77 GiB 的量化文件,提供了低于之前 18 GiB 限制的可用选项。

0 人收藏 0 人点赞
#llama-cpp

llama.cpp 开放PR列表 - CPU/内存/磁盘/混合相关 - 优化纯CPU与混合推理

Reddit r/LocalLLaMA · 2026-08-29

号召大家参与llama.cpp的开放PR,优化CPU、内存、磁盘和混合推理,提升性能,争取年底前完成。

0 人收藏 0 人点赞
#llama-cpp

@sachindetrax: 262K 上下文长度,运行于 16GB RTX 5070 Ti 显卡上。Qwen 3.8 27B Q3 模型达到约 25 tok/s,同时一个自适应 llama.cpp 分支在 RAM 和 VRAM 之间流式传输 KV 缓存…

X AI KOLs Timeline · 2026-08-29 缓存

llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。

0 人收藏 0 人点赞
#llama-cpp

Hy4的官方1位量化版本??? 👀

Reddit r/LocalLLaMA · 2026-08-29 缓存

本文介绍了Hy4预览模型的官方1位量化构建版本,提供尺寸减小的GGUF文件,以及在修改后的llama.cpp上运行的说明。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash-Next + MTP 在 Strix Halo 上:Vulkan 运行时备注

Reddit r/LocalLLaMA · 2026-08-29

在 Strix Halo 硬件上使用 llama.cpp 的 Vulkan 后端运行 Qwen3.8-Flash-Next 和 MTP 的基准测试结果,包括性能指标和对输出质量的观察。

0 人收藏 0 人点赞
#llama-cpp

AtomicChat/Qwen3.8-Flash-Next-GGUF 真的非常好

Reddit r/LocalLLaMA · 2026-08-29

AtomicChat 对 Qwen3.8-Flash-Next-GGUF 的量化显著降低了内存使用,从 106GB 减少到 65GB,同时保持了良好的推理性能,使其在硬件受限的环境中更高效。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)

Reddit r/LocalLLaMA · 2026-08-28

本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。

0 人收藏 0 人点赞
#llama-cpp

本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据

Hacker News Top · 2026-08-28 缓存

本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。

0 人收藏 0 人点赞
#llama-cpp

难以置信!我使用llama.cpp中的mmap函数,将Qwen3.8-Flash-Next IQ3_XSS放入16G+64G RAM中,速度仍达到26t/s。

Reddit r/LocalLLaMA · 2026-08-28

用户成功使用llama.cpp中的mmap函数,将Qwen3.8-Flash-Next IQ3_XSS模型放入16GB+64GB RAM中,达到26 tokens/秒的速度,这超过了更大的非MOE 30B模型。

0 人收藏 0 人点赞
#llama-cpp

在6GB显存和16GB系统内存上运行Qwen 3.8 flash next的体验

Reddit r/LocalLLaMA · 2026-08-28

一位用户分享了在配备6GB显存和16GB内存的系统上使用llama.cpp运行Qwen 3.8 flash next模型的体验,通过1位量化实现了6-7个每秒的生成速度,并寻求量化变体的推荐。

0 人收藏 0 人点赞
#llama-cpp

如何设置 llama.cpp 和 Blender 来一起创建漂亮的 3D 内容

Reddit r/LocalLLaMA · 2026-08-28

本文提供了一个逐步指南,介绍如何使用 Model Context Protocol (MCP) 设置 llama.cpp 和 Blender,通过 AI 命令生成和操作 3D 场景。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-27b q8 KV缓存似乎确实损害模型性能

Reddit r/LocalLLaMA · 2026-08-28

本文讨论了基于Qwen3.8-27B的实验,如何实时KV缓存量化因累积误差而降低长上下文模型的性能。

0 人收藏 0 人点赞
#llama-cpp

Qwen3.8-Flash-Next (UD-IQ4_XS) 在 2x RTX 3060 + 7800X3D 上的基准测试:从初始 36 tps 预填充到 400 tps 及其他基准测试(-sm tensor 陷阱)+ VRAM/RAM 使用情况

Reddit r/LocalLLaMA · 2026-08-28

本文对 llama.cpp 和 ik_llama.cpp 在双 RTX 3060 硬件上运行 Qwen3.8-Flash-Next 模型进行基准测试,展示了优化 tensor splitting 和 ubatch 设置可以将预填充速度从 36 t/s 大幅提升至 400 t/s,并对比了 RAM 使用情况。

0 人收藏 0 人点赞
#llama-cpp

我逆向工程了 NPU 厂商的引擎格式(int8 权重存储为两个半字节平面)以运行 GGUF 而无需模型转换——现在比厂商自己的运行时快 1.5 倍

Reddit r/LocalLLaMA · 2026-08-28

逆向工程了 Axera AX8850 NPU 的 int8 权重格式,以在 llama.cpp 中实现直接 GGUF 推理,在 Raspberry Pi 5 上实现了高达 24.5 t/s 的解码和 716 t/s 的预填充,性能比厂商的运行时高出 1.5 倍。

0 人收藏 0 人点赞
#llama-cpp

llama.cpp 已合并对 Qwen3.8-Flash-Next 的支持

Reddit r/LocalLLaMA · 2026-08-27 缓存

对 Qwen3.8-Flash-Next 模型的支持已合并至 llama.cpp,增强了其 C/C++ 本地大语言模型推理的能力。

0 人收藏 0 人点赞
#llama-cpp

借助HuggingFace,Nvidia也在收购llama.cpp及其背后团队

Reddit r/LocalLLaMA · 2026-08-27

Nvidia对HuggingFace的收购可能导致开源项目llama.cpp发生变化,引发对未来许可证和项目方向的担忧。

0 人收藏 0 人点赞
#llama-cpp

llama.cpp 中 DFlash2 的支持已合并!- 规范:添加 DFlash2 支持(局部卷积 + 候选选择器)由 SubSir · 拉取请求 #27342 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-08-27 缓存

DFlash2 的支持已通过拉取请求 #27342 合并到 llama.cpp 中,为 LLM 推理工具添加了局部卷积和候选选择器功能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈