gpu-optimization

标签

Cards List
#gpu-optimization

Stefano Ermon:自回归推理是顺序执行且受内存限制的。扩散模型设计用于映射到GPU——这就是它获胜的原因。

Reddit r/artificial ↗ · 8小时前

Augment Code将其编码代理后端切换到Stefano Ermon的Mercury 2.5扩散模型,在生产环境中实现了82%的延迟降低和90%的成本削减。文章强调了扩散模型的性能优势以及独立AI基准测试工具的必要性。

0 人收藏 0 人点赞
#gpu-optimization

ReBarUEFI:适用于几乎所有UEFI系统的Resizable BAR

Hacker News Top ↗ · 4天前 缓存

ReBarUEFI是一个UEFI DXE驱动程序,可在没有官方支持的系统上启用Resizable BAR,提供性能优势,并且是Intel Arc GPU获得最佳功能所必需的。

0 人收藏 0 人点赞
#gpu-optimization

@AtlasInferenceX:我们的GitHub获得了700颗星标。特别感谢开源贡献者、品牌大使以及所有中间的帮助者...

X AI KOLs Following ↗ · 4天前 缓存

Atlas是一个用纯Rust和CUDA编写的开源LLM推理引擎,实现了高性能并兼容NVIDIA和AMD硬件。

0 人收藏 0 人点赞
#gpu-optimization

Anthropic开源Claude编写的GPU优化,使30多个生物分子模型平均快约4倍

Reddit r/singularity ↗ · 2026-09-17

Anthropic已开源其AI模型Claude编写的GPU优化,显著提升了超过30个生物分子模型的速度,平均提高4倍。

0 人收藏 0 人点赞
#gpu-optimization

在16GB显存+32GB内存下运行Qwen 3.8 - 写给贫民窟GPU玩家的实用/趣味指南

Reddit r/LocalLLaMA ↗ · 2026-09-14

一位Reddit用户分享了如何在拥有16GB显存和32GB内存的系统上,通过激进量化及特定llama.cpp设置成功运行Qwen 3.8 Next MoE模型,实现了在有限硬件上高效运行大模型的效果。

0 人收藏 0 人点赞
#gpu-optimization

R9V 更新:现在在双 R9700 + 128GB RAM 上,Qwen3.8 Flash Next IQ4_XS 的文本生成中达到约 100 tok/s。修复了 n-gram SSD 流式传输的崩溃问题,改进了诊断功能,并添加了固定图像支持。现在支持 Q4_K_XL,文本生成达到 50 tok/s。

Reddit r/LocalLLaMA ↗ · 2026-09-14 缓存

R9V 更新在双 AMD R9700 GPU 上运行 Qwen3.8 Flash Next 和 IQ4_XS 时,提供约 100 tok/s 的性能,新增支持 Q4_K_XL(50 tok/s),修复崩溃问题并增强诊断功能。

0 人收藏 0 人点赞
#gpu-optimization

@zhangchitc: 为什么FlashAttention既快速又具有GPU内存高效性?

X AI KOLs Timeline ↗ · 2026-09-12

一条推文询问为什么FlashAttention在AI计算中既快速又具有GPU内存高效性。

0 人收藏 0 人点赞
#gpu-optimization

浏览器中的 1 位 27B 模型:在 6 GB RTX 3060 笔记本上实现 25–30 tok/s(WebGPU,无需安装)

Reddit r/LocalLLaMA ↗ · 2026-09-09

Mentria.ai 的浏览器推理引擎使用 WebGPU,在配备 6 GB 显存的 RTX 3060 笔记本 GPU 上,以 1 位 27B 参数模型实现了 25-30 个令牌每秒的速度,从而实现了无需服务器安装的高效 AI 推理。

0 人收藏 0 人点赞
#gpu-optimization

深入North Mini Code的Megakernel服务引擎(22分钟阅读)

TLDR AI ↗ · 2026-09-09 缓存

Cohere为North Mini Code引入了一个Megakernel服务引擎,通过优化自回归解码的内存带宽,在H100 GPU上实现了比vLLM快1.25倍至1.41倍的推理速度。

0 人收藏 0 人点赞
#gpu-optimization

LeanStream:一种用于高效设备端LLM推理的推测与精炼流式框架

arXiv cs.LG ↗ · 2026-09-04 缓存

LeanStream是一种流式推测与精炼框架,通过逐步优化计算和I/O操作,实现高效的设备端LLM推理,减少内存使用并提高吞吐量。

0 人收藏 0 人点赞
#gpu-optimization

Qwen3.8-Flash-Next 在双 RTX 3090 + DDR4 上:解码速度从 17 提升至 25-29 令牌/秒,使用专家缓存 PR

Reddit r/LocalLLaMA ↗ · 2026-09-03

用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。

0 人收藏 0 人点赞
#gpu-optimization

@PyTorch:如何在一千个GPU上高效训练一个671亿参数的模型?通常,找到最佳方案意味着...

X AI KOLs Timeline ↗ · 2026-09-01 缓存

介绍了在PyTorchCon北美大会上的一场演讲,AMD的Primus Tuning Agent通过预测最优配置,高效地在1000个GPU上训练671亿参数模型,节省计算时间。

0 人收藏 0 人点赞
#gpu-optimization

@akshay_pachaar: https://x.com/akshay_pachaar/status/2094490705024676272

X AI KOLs Following ↗ · 2026-08-31 缓存

这篇文章解释了用于在GPU上服务大型语言模型的静态、动态和连续批处理策略,详细说明了它们的权衡以及如何优化吞吐量和减少空闲时间。

0 人收藏 0 人点赞
#gpu-optimization

@xingbugengming: 兄弟们 Codex 这两个设置建议直接关掉: 我说之前切换项目和对话的时候总是要卡很久很久,鼠标有时候都动不了,原来就是这俩设置在作妖 没想到半透明边栏和动态效果占用了大量的 GPU 资源,关闭后体验瞬间丝滑多了.......

X AI KOLs Following ↗ · 2026-08-30 缓存

建议在Codex中关闭半透明边栏和动态效果以减少GPU资源占用,从而提升操作流畅度。

0 人收藏 0 人点赞
#gpu-optimization

Qwen3.8-Flash-Next 在单张96 GB显卡上支持170K上下文窗口,速度约110 tokens/秒。

Reddit r/LocalLLaMA ↗ · 2026-08-30

本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。

0 人收藏 0 人点赞
#gpu-optimization

@sachindetrax: 262K 上下文长度,运行于 16GB RTX 5070 Ti 显卡上。Qwen 3.8 27B Q3 模型达到约 25 tok/s,同时一个自适应 llama.cpp 分支在 RAM 和 VRAM 之间流式传输 KV 缓存…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。

0 人收藏 0 人点赞
#gpu-optimization

@MinLiBuilds: 真得感谢 Unsloth、SGLang 这种开源佬。 模型厂把权重放出来,只是第一步。 后面这帮人孜孜不倦地做适配、写 Kernel、降显存、提速度、补工具、写教程,甚至连免费算力入口都给你铺好。 没有这些人,很多所谓“开源模型”,其实就…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

这篇文章赞扬了像Unsloth和SGLang这样的开源贡献者,他们通过优化工具和技术,使普通人能够在消费级GPU上微调大型语言模型,如Qwen3.8-27B,降低了AI开发的门槛。

0 人收藏 0 人点赞
#gpu-optimization

在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南

Reddit r/LocalLLaMA ↗ · 2026-08-26

本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。

0 人收藏 0 人点赞
#gpu-optimization

@gpusteve: 想学习我们如何提供超快速的开源模型的基础知识?从这里开始,线程中有链接提供深入的知识…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

该推文宣布了AI性能工程资源列表的重大更新,为学习GPU和AI优化技术提供了全面的材料。

0 人收藏 0 人点赞
#gpu-optimization

我fork了Ninfer 3090并将其转换为在CMP170HX上运行 - 使llama.cpp的Qwen3.6-35B性能翻倍

Reddit r/LocalLLaMA ↗ · 2026-08-22

一位用户fork了Ninfer推理引擎以在CMP170HX GPU上运行,使llama.cpp的Qwen3.6-35B模型性能翻倍,并分享了配置细节。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈