vram-optimization

标签

Cards List
#vram-optimization

@DavidFSWD: 本周本地AI最惊人的事是这个优化过的Qwen 3.8模型:ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF…

X AI KOLs Timeline ↗ · 2天前 缓存

这条推文强调了一个优化版本的Qwen 3.8模型,该模型可以在显存低于16GB的本地硬件上高效运行,在较旧的GPU配置上达到30-80个令牌每秒的速度。

0 人收藏 0 人点赞
#vram-optimization

@Anbeeld: BeeLlama v0.4.7 发布了!在使用 MTP 和 DFlash 时,您可以节省数 GB 的 VRAM!在图像中展示的示例中…

X AI KOLs Timeline ↗ · 3天前

BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。

0 人收藏 0 人点赞
#vram-optimization

Qwen3.8-Flash-Next 在 NVIDIA 5090 和 64GB 内存配置下使用 Llama.cpp - 似乎未使用 RAM?

Reddit r/LocalLLaMA ↗ · 4天前

用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。

0 人收藏 0 人点赞
#vram-optimization

真诚提问:更小的量化模型是否正在成为本地AI的最佳选择?

Reddit r/LocalLLaMA ↗ · 2026-09-19

文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。

0 人收藏 0 人点赞
#vram-optimization

这款草稿模型在16 GB显卡上为Qwen 3.8 27b性能卓越

Reddit r/LocalLLaMA ↗ · 2026-09-12

针对Qwen 3.8 27B的草稿模型在16 GB GPU上非常有效,在RX 9070 XT上可达到约60 token/秒的速度,并提供比内置MTP更好的VRAM效率。

0 人收藏 0 人点赞
#vram-optimization

有闲置的老旧低显存GPU吗?或许可以用来运行 Just Vision mmproj llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-09-12

文章建议利用旧GPU卸载llama.cpp中的mmproj组件,以提升多模态处理速度,同时不影响推理性能,作为缓慢的--no-mmproj-offload选项的替代方案。

0 人收藏 0 人点赞
#vram-optimization

别错过EXL3量化技术

Reddit r/LocalLLaMA ↗ · 2026-08-30

作者分享了在12GB显存GPU上运行使用EXL3量化的30B参数模型的经验,实现了编码和代理任务的高效性能和速度。

0 人收藏 0 人点赞
#vram-optimization

@nb4ld: 我的首个@huggingface上传 Qwen3.8-27B-DFlash2 for Blackwell - 最终解码速度相同 - 输出质量相同 - 2.6x 显存减少…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

发布针对NVIDIA Blackwell GPU优化的Qwen3.8-27B-DFlash2模型的量化版本,实现类似的解码速度和输出质量,显存使用减少2.6倍,并扩展上下文长度。

0 人收藏 0 人点赞
#vram-optimization

为本地LLM提供大量答案的新旧基准测试

Reddit r/LocalLLaMA ↗ · 2026-08-22

本文介绍了一个用于评估本地LLM配置的基准测试工具,重点关注显存使用情况、性能指标和硬件优化,以协助开发者优化配置。

0 人收藏 0 人点赞
#vram-optimization

16GB显存炼狱讨论帖

Reddit r/LocalLLaMA ↗ · 2026-08-22

一个讨论帖,分享在16GB显存Windows系统上运行AI模型如Qwen3.8-27B的配置和技巧,专注于内存优化技术。

0 人收藏 0 人点赞
#vram-optimization

Ling 3.0 Tiny 成为 Hermes(Qwen 3.8 27B 作为主要模型)的优秀辅助模型

Reddit r/LocalLLaMA ↗ · 2026-08-20

一位用户分享了他们的设置,使用 Ling 3.0 Tiny 作为 Hermes(Qwen 3.8 27B)的辅助模型来处理简单任务,如上下文压缩和摘要生成,从而提高速度和效率,且不影响质量。

0 人收藏 0 人点赞
#vram-optimization

在 Qwen 3.8 27B 上处理超过 100 万 token 后,以下是我针对 16GB 显存(73k 上下文长度,智能体编码场景)调校出的 llama.cpp 最佳配置。

Reddit r/LocalLLaMA ↗ · 2026-08-17

本文分享了针对16GB显存、73k上下文窗口优化的llama.cpp配置方案,用于运行Qwen 3.8 27B模型,并通过实际软件工程项目展示了该配置在智能编码工作流中的性能表现。

0 人收藏 0 人点赞
#vram-optimization

在 2x DGX Spark 上部署 DeepSeek v4 Flash 0731 — 5-7 GB 操作系统余量,你会如何降低 VRAM 占用并增加操作系统可用 RAM?

Reddit r/LocalLLaMA ↗ · 2026-08-07

用户在使用 vLLM 在两台 DGX Spark 机器上部署 DeepSeek-V4-Flash-0731 时,寻求社区关于降低 VRAM 占用和释放操作系统 RAM 的建议,分享了详细的配置和内存测量数据。

0 人收藏 0 人点赞
#vram-optimization

BeeLlama.cpp v0.4.1:KVarN、KV精度尾部、q2_0-q3_1 KV缓存,改进支持。KLD基准测试:尾部1024使kvarn5和q6_0匹配q8_0,且显存占用大幅降低

Reddit r/LocalLLaMA ↗ · 2026-07-26

BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。

0 人收藏 0 人点赞
#vram-optimization

Spiritbuun 的 VBR(可变比特率)KV 缓存 —— 初印象

Reddit r/LocalLLaMA ↗ · 2026-07-14

一篇对 Spiritbuun 的 llama.cpp 分支的赞赏文章,重点介绍了其新的可变比特率(VBR)KV 缓存功能,该功能动态降低缓存精度以适应 VRAM,从而实现更大的自动适配上下文大小且速度损失极小。

0 人收藏 0 人点赞
#vram-optimization

@sakurayukiai: 通过计算推测模型的KV缓存字节数(而非将其隐藏在平坦的显存缓冲中),Unsloth将Qwen…

X AI KOLs Timeline ↗ · 2026-07-13

Unsloth通过精确计算推测模型的KV缓存字节数(而非使用平坦的显存缓冲),将Qwen3.6-27B Q6_K在单张32GB显卡上的上下文长度从23K提升至64K。

0 人收藏 0 人点赞
#vram-optimization

在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文

Reddit r/LocalLLaMA ↗ · 2026-07-05

用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。

0 人收藏 0 人点赞
#vram-optimization

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA ↗ · 2026-06-20

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

0 人收藏 0 人点赞
#vram-optimization

7900XTX 24GB 显存,终于能够在 131k 上下文下容纳 Q6K+MTP 和 Qwen 3.6 27B

Reddit r/LocalLLaMA ↗ · 2026-06-20

在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。

0 人收藏 0 人点赞
#vram-optimization

@SergioPaniego:连续批处理刚刚在TRL的GRPO中实现,在64次生成时,它比普通生成运行更快且使用更少的VRAM…

X AI KOLs Following ↗ · 2026-06-19 缓存

连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈