hardware-efficiency

标签

Cards List
#hardware-efficiency

令牌便宜到无需计量

Lobsters Hottest ↗ · 2026-09-22 缓存

本文讨论了 AI 令牌成本的快速下降,预测 LLMs 将在未来几年内广泛集成到计算基础设施中,并在消费级硬件上进行本地部署,重点转向质量和可访问性。

0 人收藏 0 人点赞
#hardware-efficiency

HBQ:面向精确LLM推理的硬件效率感知层次化缩放块量化

arXiv cs.LG ↗ · 2026-09-02 缓存

HBQ引入了一种层次化缩放块量化技术,用于LLM推理,该技术在保持精度的同时提高了硬件效率,超越了先前的方法。

0 人收藏 0 人点赞
#hardware-efficiency

@TheAhmadOsman: GLM 5.3 Flash 和 Qwen 3.8 Flash Next 是本地AI进步的绝佳范例,这是一个积极的时间线

X AI KOLs Timeline ↗ · 2026-08-26 缓存

这条推文探讨了本地AI的进展,强调了像GLM 5.3 Flash和Qwen 3.8 Flash Next这样的模型现在能够在单个GPU上运行,从而改善了对硬件的要求。

0 人收藏 0 人点赞
#hardware-efficiency

@TheAhmadOsman: 预测我们将在不到18个月内,在单张RTX PRO 6000上获得与Kimi K3相当的智能 如何?…

X AI KOLs Following ↗ · 2026-08-15 缓存

一位Twitter用户预测,与Kimi K3相当的AI智能将在18个月内运行在单张RTX PRO 6000 GPU上,并后来指出Opus 4.6 Max的质量已经可以在单张RTX 5090上运行。

0 人收藏 0 人点赞
#hardware-efficiency

Tensordyne 发布对数AI计算芯片:每瓦特令牌数比NVIDIA Blackwell多17倍,吞吐量高13倍。

Reddit r/singularity ↗ · 2026-06-15

Tensordyne 宣布了一项突破性推理系统,在硬件中使用对数数学,声称每瓦特令牌数比NVIDIA Blackwell多17倍,吞吐量高13倍,这是通过将对数空间中的复杂乘法替换为简单加法实现的。

0 人收藏 0 人点赞
#hardware-efficiency

面向Tensix架构的大语言模型推理中的算子融合

arXiv cs.LG ↗ · 2026-06-10 缓存

本文提出了一种针对Tenstorrent Tensix架构上大语言模型推理的算子融合策略,将RMSNorm与矩阵乘法融合,以提高数据局部性并减少DRAM访问。在Wormhole平台上,使用Qwen2.5-0.5B、Qwen3-0.6B和Qwen3-4B进行的实验显示,注意力模块延迟降低高达37.44%,MLP延迟降低15.89%。

0 人收藏 0 人点赞
#hardware-efficiency

# LiftQuant:基于维度提升与投影的连续比特宽度大语言模型量化

arXiv cs.LG ↗ · 2026-06-04 缓存

# LiftQuant 引入"先提升后投影"机制,实现大语言模型的连续(非整数)位宽量化,精准适配硬件内存预算。该框架将 70B 大语言模型压缩至 2.4 位以适配 24GB GPU,性能超越当前最先进的 2 位模型。

0 人收藏 0 人点赞
#hardware-efficiency

@ClementDelangue:笔记本上本地开放权重 AI 的进步速度已超过摩尔定律的两倍!从 2024 年 5 月到 202…

X AI KOLs Following ↗ · 2026-05-11

Hugging Face CEO Clement Delangue 表示,在硬件配置不变的情况下,笔记本端本地开放权重 AI 的性能提升速度已达摩尔定律的 4.7 倍,并以模型从 Llama 3 70B 演进至 DeepSeek V4 Flash 的进展作为佐证。

0 人收藏 0 人点赞
#hardware-efficiency

@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…

X AI KOLs Following ↗ · 2026-05-08

本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。

0 人收藏 0 人点赞
#hardware-efficiency

@no_stp_on_snek: 长上下文实验的小更新:我在单个 MI300X droplet 上使用开源栈成功将 MRCR v2 运行到 1M 上下文长度。

X AI KOLs Following ↗ · 2026-05-07

作者报告成功在单个 MI300X 上使用 Qwen2.5-32B 和 FAISS 运行 MRCR v2,实现 1M 上下文长度,并以低成本获得有竞争力的分数。

0 人收藏 0 人点赞
#hardware-efficiency

KernelBench-X:评估LLM生成GPU内核的综合基准测试

Hugging Face Daily Papers ↗ · 2026-05-06 缓存

KernelBench-X是一个用于评估LLM生成GPU内核的新基准,揭示了任务结构对正确性的影响大于方法设计,且正确性并不保证硬件效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈