标签
Augment Code将其编码代理后端切换到Stefano Ermon的Mercury 2.5扩散模型,在生产环境中实现了82%的延迟降低和90%的成本削减。文章强调了扩散模型的性能优势以及独立AI基准测试工具的必要性。
ReBarUEFI是一个UEFI DXE驱动程序,可在没有官方支持的系统上启用Resizable BAR,提供性能优势,并且是Intel Arc GPU获得最佳功能所必需的。
Atlas是一个用纯Rust和CUDA编写的开源LLM推理引擎,实现了高性能并兼容NVIDIA和AMD硬件。
Anthropic已开源其AI模型Claude编写的GPU优化,显著提升了超过30个生物分子模型的速度,平均提高4倍。
一位Reddit用户分享了如何在拥有16GB显存和32GB内存的系统上,通过激进量化及特定llama.cpp设置成功运行Qwen 3.8 Next MoE模型,实现了在有限硬件上高效运行大模型的效果。
R9V 更新在双 AMD R9700 GPU 上运行 Qwen3.8 Flash Next 和 IQ4_XS 时,提供约 100 tok/s 的性能,新增支持 Q4_K_XL(50 tok/s),修复崩溃问题并增强诊断功能。
一条推文询问为什么FlashAttention在AI计算中既快速又具有GPU内存高效性。
Mentria.ai 的浏览器推理引擎使用 WebGPU,在配备 6 GB 显存的 RTX 3060 笔记本 GPU 上,以 1 位 27B 参数模型实现了 25-30 个令牌每秒的速度,从而实现了无需服务器安装的高效 AI 推理。
Cohere为North Mini Code引入了一个Megakernel服务引擎,通过优化自回归解码的内存带宽,在H100 GPU上实现了比vLLM快1.25倍至1.41倍的推理速度。
LeanStream是一种流式推测与精炼框架,通过逐步优化计算和I/O操作,实现高效的设备端LLM推理,减少内存使用并提高吞吐量。
用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。
介绍了在PyTorchCon北美大会上的一场演讲,AMD的Primus Tuning Agent通过预测最优配置,高效地在1000个GPU上训练671亿参数模型,节省计算时间。
这篇文章解释了用于在GPU上服务大型语言模型的静态、动态和连续批处理策略,详细说明了它们的权衡以及如何优化吞吐量和减少空闲时间。
建议在Codex中关闭半透明边栏和动态效果以减少GPU资源占用,从而提升操作流畅度。
本文介绍了一种使用量化n-gram运行Qwen3.8-Flash-Next模型的方法,可在单张96GB显卡上实现超过17万token的上下文长度。通过INT4量化技术配合内存映射磁盘访问,处理速度最高可达每秒110个token。
llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。
这篇文章赞扬了像Unsloth和SGLang这样的开源贡献者,他们通过优化工具和技术,使普通人能够在消费级GPU上微调大型语言模型,如Qwen3.8-27B,降低了AI开发的门槛。
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
该推文宣布了AI性能工程资源列表的重大更新,为学习GPU和AI优化技术提供了全面的材料。
一位用户fork了Ninfer推理引擎以在CMP170HX GPU上运行,使llama.cpp的Qwen3.6-35B模型性能翻倍,并分享了配置细节。