hardware-optimization

标签

Cards List
#hardware-optimization

Qwen 27B 3.8 量化:极限在哪里?

Reddit r/LocalLLaMA ↗ · 2026-08-24

一位用户分享了在 Mac mini M4 上使用 Unsloth 的 Q3 XXS 量化版本运行 Qwen 27B 3.8 的积极体验,并询问他人对低于 Q3 量化版本的使用感受。

0 人收藏 0 人点赞
#hardware-optimization

在128GB内存与约60GB显存(PCIe配置较弱)环境下运行DeepSeek-V4-Flash-0731 q4+量化版本的三次实验:实现可接受的生成速度和提示处理速度

Reddit r/LocalLLaMA ↗ · 2026-08-22

作者在配备128GB内存的系统上实验运行DeepSeek-V4-Flash-0731的4位量化模型,通过内存锁定和提示处理策略等优化手段,达到了可接受的推理速度。

0 人收藏 0 人点赞
#hardware-optimization

Dropbox:当需求上升时,增加更多硬件似乎是最显而易见的答案。但这并不总是最佳选择。这里是……

X AI KOLs Timeline ↗ · 2026-08-20 缓存

Dropbox 探讨了为应对不断增长的 AI 需求而提高基础设施效率的策略,重点关注系统级优化,而不仅仅是增加更多硬件。

0 人收藏 0 人点赞
#hardware-optimization

如何在重新启动 llama.cpp 后处理长上下文会话?

Reddit r/LocalLLaMA ↗ · 2026-08-20

用户提出在 llama.cpp 中为长上下文会话实现自动缓存机制,以避免重启后的重复预填充,提升在较慢硬件上的可用性。

0 人收藏 0 人点赞
#hardware-optimization

PTXBench:基于架构特定PTX的GPU内核优化基准测试与LLM适配

arXiv cs.CL ↗ · 2026-08-19 缓存

PTXBench被介绍为一个基准,用于评估和适配大型语言模型,以使用架构特定的PTX优化GPU内核,显示性能不均和微调见解。

0 人收藏 0 人点赞
#hardware-optimization

Qwen 3.8 27b 发布:本地AI的重大新闻

Reddit r/ArtificialInteligence ↗ · 2026-08-14

Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。

0 人收藏 0 人点赞
#hardware-optimization

@vivekgalatage: GPU Programming Fundamentals https://youtu.be/Cl2B_hmg4gA William Brandon, a performance engineer at Anthropic, outline…

X AI KOLs Timeline ↗ · 2026-08-04 缓存

William Brandon(Anthropic 性能工程师)的 GPU 编程基础讲座摘要,强调理解 GPU 硬件的流式多处理器(SM)结构是预测性能的关键,而非仅从线程块/线程的软件抽象出发。

0 人收藏 0 人点赞
#hardware-optimization

GPU管理:闲置的GPU为何成为新的停飞飞机

Hugging Face Blog ↗ · 2026-07-30 缓存

本文认为,GPU利用率正成为企业AI的关键瓶颈,类似于航空中的飞机利用率,而闲置的GPU代表着浪费的算力,这种算力决定了竞争优势。

0 人收藏 0 人点赞
#hardware-optimization

@PyTorch:在大型语言模型和推荐系统中,归一化层常因硬件分块要求独特而导致内存瓶颈…

X AI KOLs Following ↗ · 2026-07-10 缓存

Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。

0 人收藏 0 人点赞
#hardware-optimization

关于在 4x5060 ti 分叉上排查 P2P 问题的发现

Reddit r/LocalLLaMA ↗ · 2026-06-27

关于 PCIe 分叉和 4 路 GPU 配置中 P2P 性能问题的详细发现,包括张量并行和流水线并行的解决方法及替代方案。

0 人收藏 0 人点赞
#hardware-optimization

@TheAhmadOsman:本地AI现在变得简单——将下面的文章交给Codex Cli,并告诉它:- 根据您的硬件推断正确的推理引擎…

X AI KOLs Timeline ↗ · 2026-05-21 缓存

推广Codex CLI,该工具可自动推断正确的推理引擎并针对给定硬件优化本地AI性能。

0 人收藏 0 人点赞
#hardware-optimization

@ycombinator:General Instinct (@gen_instinct) 将前沿AI模型部署到受限边缘硬件上,助力机器人技术和物理…

X AI KOLs Following ↗ · 2026-05-19

General Instinct 推出一个部署层,使前沿AI模型能够在如 Jetson 和移动 NPU 等受限边缘硬件上运行,帮助机器人技术和物理AI团队实现低延迟离线推理。

0 人收藏 0 人点赞
#hardware-optimization

@berryxia: 一次将大模型的格式搞清楚!盘它! 很多朋友都在讨论大模型的这么多格式,到底有啥区别? 于是想一篇把 GGUF、MLX 这些本地大模型格式弄清楚。 简单说,GGUF 是 llama.cpp 团队搞出来的单文件格式,现在已经是本地推理最主流的…

X AI KOLs Timeline ↗ · 2026-05-11

本文详细对比了GGUF、MLX、Safetensors等主流本地大模型文件格式的特点与应用场景,帮助开发者根据硬件环境选择最优格式。

0 人收藏 0 人点赞
#hardware-optimization

小众观点:DGX Spark 论坛的开发者社区天赋异禀,将凭意志力让有缺陷的硬件成功。

Reddit r/LocalLLaMA ↗ · 2026-05-08

一篇观点文章,重点介绍蓬勃发展的 DGX Spark 开发者社区,该社区正在协作优化硬件,尽管存在局限性,还提到了 Sparkrun 和 PrismaQuant 等项目。

0 人收藏 0 人点赞
#hardware-optimization

LogosKG:面向硬件优化、可扩展且可解释的知识图谱检索

arXiv cs.CL ↗ · 2026-04-22 缓存

LogosKG 提出一种贴合硬件的框架,可在含十亿条边的知识图谱上实现可扩展、可解释的多跳检索;通过度感知分区与按需缓存提升效率,同时不损失保真度。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈