gpu-computing

标签

Cards List
#gpu-computing

@pochenai: 受 @percyliang 的 CS336 启发,我构建了一个用于 LLM 推理的静态性能模型——无动态批处理/分块,j…

X AI KOLs Following ↗ · 2026-08-28 缓存

受 CS336 启发,一个用于 LLM 推理的静态性能模型提供了 VRAM、time-to-first-token 和吞吐量的分析界限,涵盖多种配置,并针对公开基准进行校准。

0 人收藏 0 人点赞
#gpu-computing

@0x0SojalSec: 你的手机通过本地部署的超智能 Qwen 3.8 27B(运行在 3090 显卡上)获得了强大能力,借助 Tailscale 远程连接。AI 智能体正在设计一个相机应用…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

一位用户展示了通过 Tailscale 在本地 3090 显卡上运行 Qwen 3.8 27B 模型,并利用 AI 智能体设计了一个具备实时预览、物体识别功能的相机应用,该模型具有高速的 token 生成能力。

0 人收藏 0 人点赞
#gpu-computing

@TheAhmadOsman: GLM 5.3 Flash 和 Qwen 3.8 Flash Next 是本地AI进步的绝佳范例,这是一个积极的时间线

X AI KOLs Timeline ↗ · 2026-08-26 缓存

这条推文探讨了本地AI的进展,强调了像GLM 5.3 Flash和Qwen 3.8 Flash Next这样的模型现在能够在单个GPU上运行,从而改善了对硬件的要求。

0 人收藏 0 人点赞
#gpu-computing

用于AMD MI350X的Qwen3.6-35B-A3B开源内核:在8块GPU上实现78,498输出tok/s

Reddit r/LocalLLaMA ↗ · 2026-08-26

本文介绍了为在AMD MI350X GPU上运行Qwen3.6-35B-A3B大语言模型所做的优化,实现了高输出令牌吞吐量,并开源了内核以提升性能。

0 人收藏 0 人点赞
#gpu-computing

面向内存高效的稀疏二进制自组织映射的特征主码本:在单消费级GPU上将MEDLINE图谱扩展至105万神经元

arXiv cs.LG ↗ · 2026-08-26 缓存

本文提出了一种特征主码本布局,用于内存高效的稀疏二进制自组织映射,使得在单个GPU上训练多达105万神经元的大规模映射成为可能,并在MEDLINE数据上实现了显著的加速。

0 人收藏 0 人点赞
#gpu-computing

今天,我合并了第一个完全由我的4060Ti 16GB编写的功能分支!

Reddit r/LocalLLaMA ↗ · 2026-08-25

一位开发者分享了使用在4060Ti GPU上运行的量化版Qwen 3.8 27B模型,自主编写并合成功能分支的经验,展示了在编码任务中本地AI的重大进展。

0 人收藏 0 人点赞
#gpu-computing

TorchMorph:CUDA加速的形态学变换

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

TorchMorph是一个CUDA加速的PyTorch扩展,提供GPU优化的形态学和距离变换算子,与SciPy等CPU实现相比,实现了显著的加速,并保持了兼容的API。

0 人收藏 0 人点赞
#gpu-computing

Hot Chips 2026: CUDA 瞄准 RISC-V – 作者:Chester Lam

Hacker News Top ↗ · 2026-08-24 缓存

在 Hot Chips 2026 上,Nvidia 宣布了将 CUDA 支持扩展到 RISC-V CPU 的计划,概述了具体的硬件要求,如服务器级CPU、ACPI和PCIe一致性,以实现高效的GPU计算。

0 人收藏 0 人点赞
#gpu-computing

Ling Tiny:速度之王

Reddit r/LocalLLaMA ↗ · 2026-08-23

Ling Tiny 已替代 Gemma4-12B 作为辅助模型在 4060Ti GPU 上,提供了惊人的速度;用户应避免使用 MTP,并使用 vLLM fork 来支持 BailingMoE3。

0 人收藏 0 人点赞
#gpu-computing

@cyrilXBT: 太不可思议了。Qwen 3.8 27B 现在在本地 RTX 4060 上仅用 8GB 显存就能愉快运行。你看到的这是一个 64k 上下文…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

一位用户分享称,Qwen 3.8 27B 模型通过 Unsloth 的 IQ4_XS 量化,在仅有 8GB 显存的 RTX 4060 上本地运行,实现了 64k 上下文窗口和令人印象深刻的性能指标。

0 人收藏 0 人点赞
#gpu-computing

我做到了!我自由了!距离我使用claudecode已经过去7小时了

Reddit r/LocalLLaMA ↗ · 2026-08-21

用户的Claude Code订阅过期后,他们转而使用本地模型如Qwen3.8-27b和Pi,并在编码任务和应用开发中将其性能与Claude Sonnet 5进行比较。

0 人收藏 0 人点赞
#gpu-computing

NVFP4 在 Volta 上!尽管是为 Blackwell 设计的,我让四个 2017 年的 V100 原生运行 Qwen 3.8 NVFP4,并匹配我的 6000 美元 RTX 5090。

Reddit r/LocalLLaMA ↗ · 2026-08-19

作者在使用自定义软件优化(如 QPN 内核)进行高效推理时,实现了四个 2017 年 Tesla V100 GPU 与现代 RTX 5090 在运行 Qwen 3.8 模型时的性能均等。

0 人收藏 0 人点赞
#gpu-computing

@no_stp_on_snek: 看看Buun的工作,他在大展身手。

X AI KOLs Following ↗ · 2026-08-19 缓存

一位用户突出了Buun在优化AI模型方面的工作,实现了在单张3090 GPU上对Qwen 3.6的高速推理,并为Qwen 3.8开发了DFlash2。

0 人收藏 0 人点赞
#gpu-computing

@fedebruzzone7: 从范畴论的角度:CuTe 布局的范畴基础 https://arxiv.org/abs/2601.05972

X AI KOLs Timeline ↗ · 2026-08-18 缓存

本文引入了一个范畴框架来形式化 NVIDIA 的 CUTLASS 库中的布局代数,定义了范畴和态射以表征张量布局,并提供了一个 Python 实现以及兼容性证明。

0 人收藏 0 人点赞
#gpu-computing

5090:Windows 或 Linux 用于 Qwen3.8.27b

Reddit r/LocalLLaMA ↗ · 2026-08-16

用户寻求建议,关于在配备 RTX 5090 和 96GB RAM 的专用 AI 机上运行 Qwen3.8.27b 模型的最佳操作系统(Windows 或 Linux)和推理服务器,以获得最佳性能。

0 人收藏 0 人点赞
#gpu-computing

@TheAhmadOsman: 预测我们将在不到18个月内,在单张RTX PRO 6000上获得与Kimi K3相当的智能 如何?…

X AI KOLs Following ↗ · 2026-08-15 缓存

一位Twitter用户预测,与Kimi K3相当的AI智能将在18个月内运行在单张RTX PRO 6000 GPU上,并后来指出Opus 4.6 Max的质量已经可以在单张RTX 5090上运行。

0 人收藏 0 人点赞
#gpu-computing

SpaceX正式完成对Cursor的收购

TechCrunch AI ↗ · 2026-08-15 缓存

SpaceX正式完成以600亿美元收购AI编程初创公司Cursor的交易,将Cursor的AI能力与SpaceX庞大的GPU计算基础设施相结合,以推动AI发展。

0 人收藏 0 人点赞
#gpu-computing

@matthewjgunton: NVIDIA 软件栈中有 3 个基本层级:CUDA C++、PTX 和 SASS。理解全部 3 个层级有助于你明白为什么 CU…

X AI KOLs Timeline ↗ · 2026-08-07 缓存

一条教育性推文,解释了 NVIDIA 软件栈的三个层级(CUDA C++、PTX、SASS),以及 CUDA 的抽象如何构建护城河,同时提到 Luminal 的自动编译器搜索。

0 人收藏 0 人点赞
#gpu-computing

@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …

X AI KOLs Following ↗ · 2026-08-03 缓存

TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.

0 人收藏 0 人点赞
#gpu-computing

面向张量核的算子感知混合精度容差校准

arXiv cs.LG ↗ · 2026-07-21 缓存

本文提出了一种算子感知的校准方法,用于张量核正确性测试中的绝对容差校准,利用误差分布数据设定更严格的阈值。该方法在缺陷检测中将召回率绝对提升了9.3%,且误报极少,在gpuemu语料库上得到了验证。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈