vram-optimization

标签

Cards List
#vram-optimization

这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越

Reddit r/LocalLLaMA · 5天前

针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。

0 人收藏 0 人点赞
#vram-optimization

有闲置的老旧低显存GPU吗?或许可以用来运行 Just Vision mmproj llama.cpp

Reddit r/LocalLLaMA · 6天前

文章建议利用旧GPU卸载llama.cpp中的mmproj组件,以提升多模态处理速度,同时不影响推理性能,作为缓慢的--no-mmproj-offload选项的替代方案。

0 人收藏 0 人点赞
#vram-optimization

别错过EXL3量化技术

Reddit r/LocalLLaMA · 2026-08-30

作者分享了在12GB显存GPU上运行使用EXL3量化的30B参数模型的经验,实现了编码和代理任务的高效性能和速度。

0 人收藏 0 人点赞
#vram-optimization

@nb4ld: 我的首个@huggingface上传 Qwen3.8-27B-DFlash2 for Blackwell - 最终解码速度相同 - 输出质量相同 - 2.6x 显存减少…

X AI KOLs Timeline · 2026-08-29 缓存

发布针对NVIDIA Blackwell GPU优化的Qwen3.8-27B-DFlash2模型的量化版本,实现类似的解码速度和输出质量,显存使用减少2.6倍,并扩展上下文长度。

0 人收藏 0 人点赞
#vram-optimization

为本地LLM提供大量答案的新旧基准测试

Reddit r/LocalLLaMA · 2026-08-22

本文介绍了一个用于评估本地LLM配置的基准测试工具,重点关注显存使用情况、性能指标和硬件优化,以协助开发者优化配置。

0 人收藏 0 人点赞
#vram-optimization

16GB显存炼狱讨论帖

Reddit r/LocalLLaMA · 2026-08-22

一个讨论帖,分享在16GB显存Windows系统上运行AI模型如Qwen3.8-27B的配置和技巧,专注于内存优化技术。

0 人收藏 0 人点赞
#vram-optimization

Ling 3.0 Tiny 成为 Hermes(Qwen 3.8 27B 作为主要模型)的优秀辅助模型

Reddit r/LocalLLaMA · 2026-08-20

一位用户分享了他们的设置,使用 Ling 3.0 Tiny 作为 Hermes(Qwen 3.8 27B)的辅助模型来处理简单任务,如上下文压缩和摘要生成,从而提高速度和效率,且不影响质量。

0 人收藏 0 人点赞
#vram-optimization

在 Qwen 3.8 27B 上处理超过 100 万 token 后,以下是我针对 16GB 显存(73k 上下文长度,智能体编码场景)调校出的 llama.cpp 最佳配置。

Reddit r/LocalLLaMA · 2026-08-17

本文分享了针对16GB显存、73k上下文窗口优化的llama.cpp配置方案,用于运行Qwen 3.8 27B模型,并通过实际软件工程项目展示了该配置在智能编码工作流中的性能表现。

0 人收藏 0 人点赞
#vram-optimization

在 2x DGX Spark 上部署 DeepSeek v4 Flash 0731 — 5-7 GB 操作系统余量,你会如何降低 VRAM 占用并增加操作系统可用 RAM?

Reddit r/LocalLLaMA · 2026-08-07

用户在使用 vLLM 在两台 DGX Spark 机器上部署 DeepSeek-V4-Flash-0731 时,寻求社区关于降低 VRAM 占用和释放操作系统 RAM 的建议,分享了详细的配置和内存测量数据。

0 人收藏 0 人点赞
#vram-optimization

BeeLlama.cpp v0.4.1:KVarN、KV精度尾部、q2_0-q3_1 KV缓存,改进支持。KLD基准测试:尾部1024使kvarn5和q6_0匹配q8_0,且显存占用大幅降低

Reddit r/LocalLLaMA · 2026-07-26

BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。

0 人收藏 0 人点赞
#vram-optimization

Spiritbuun 的 VBR(可变比特率)KV 缓存 —— 初印象

Reddit r/LocalLLaMA · 2026-07-14

一篇对 Spiritbuun 的 llama.cpp 分支的赞赏文章,重点介绍了其新的可变比特率(VBR)KV 缓存功能,该功能动态降低缓存精度以适应 VRAM,从而实现更大的自动适配上下文大小且速度损失极小。

0 人收藏 0 人点赞
#vram-optimization

@sakurayukiai: 通过计算推测模型的KV缓存字节数(而非将其隐藏在平坦的显存缓冲中),Unsloth将Qwen…

X AI KOLs Timeline · 2026-07-13

Unsloth通过精确计算推测模型的KV缓存字节数(而非使用平坦的显存缓冲),将Qwen3.6-27B Q6_K在单张32GB显卡上的上下文长度从23K提升至64K。

0 人收藏 0 人点赞
#vram-optimization

在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文

Reddit r/LocalLLaMA · 2026-07-05

用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。

0 人收藏 0 人点赞
#vram-optimization

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA · 2026-06-20

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

0 人收藏 0 人点赞
#vram-optimization

7900XTX 24GB 显存,终于能够在 131k 上下文下容纳 Q6K+MTP 和 Qwen 3.6 27B

Reddit r/LocalLLaMA · 2026-06-20

在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。

0 人收藏 0 人点赞
#vram-optimization

@SergioPaniego:连续批处理刚刚在TRL的GRPO中实现,在64次生成时,它比普通生成运行更快且使用更少的VRAM…

X AI KOLs Following · 2026-06-19 缓存

连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。

0 人收藏 0 人点赞
#vram-optimization

@0xSero:适合你硬件的最佳模型——4GB到12GB显存——VibeThinker-3B——秒杀所有同量级模型……

X AI KOLs Timeline · 2026-06-18 缓存

本推文推荐了针对不同显存容量优化的AI模型,重点介绍了VibeThinker-3B在3B参数量下的强大推理能力,以及其他用于编程和通用场景的模型。

0 人收藏 0 人点赞
#vram-optimization

llama.cpp - 如何在GPU上释放更多空间

Reddit r/LocalLLaMA · 2026-06-17

一则讨论如何在llama.cpp中释放GPU内存实用技巧的帖子,例如将mmproj卸载到CPU、调整KV缓存类型,同时讨论了--cache-type-k/v和--spec-draft-n-max等参数。

0 人收藏 0 人点赞
#vram-optimization

llama.cpp 中的流水线并行可能浪费你的显存

Reddit r/LocalLLaMA · 2026-06-08

测试表明,llama.cpp 默认的流水线并行浪费显存且无速度提升;通过编译时设置 GGML_SCHED_MAX_COPIES=1 可节省大量显存,同时保持相同推理速度。

0 人收藏 0 人点赞
#vram-optimization

@analogalok: 在8GB显存上以20+ token/秒运行Gemma 4 26B MoE,支持250k上下文。如果你有8GB显存显卡,停下你正在做的事……

X AI KOLs Timeline · 2026-06-07 缓存

Alok演示了使用Unsloth的QAT量化以及llama.cpp中的-cmoe标志,在8GB显存上运行Gemma 4 26B MoE,实现了250k上下文下20 token/秒的速度,这标志着廉价本地AI的一个重要里程碑。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈