nvidia-gpu

标签

Cards List
#nvidia-gpu

单张 RTX 5090 运行 Qwen3.8:27b 实现 85.6 token/s MTP

Reddit r/LocalLLaMA ↗ · 16小时前

在单张 RTX 5090 GPU 上使用 Qwen3.8:27b 模型,达到每秒 85.6 token 的性能。

0 人收藏 0 人点赞
#nvidia-gpu

如果你有3090或其他30xx显卡用于本地大语言模型,我有些东西要给你

Reddit r/LocalLLaMA ↗ · 2026-09-15

本文介绍了一个针对NVIDIA Ampere架构GPU(如3090)优化的llama.cpp自定义分支,能够在大上下文窗口下为27B参数模型实现每秒超过90个令牌的速度,使得本地推理速度快于API速度。

0 人收藏 0 人点赞
#nvidia-gpu

Kanverse GPU Borrow

Product Hunt ↗ · 2026-09-13 缓存

Kanverse GPU Borrow 是一款产品,允许设备在用户明确授权下,通过 Blink Bridge 临时借用其他机器的GPU计算资源,并由 GPT-6 Astra 编排。

0 人收藏 0 人点赞
#nvidia-gpu

Ninfer Studio - 哦,又一个工具

Reddit r/LocalLLaMA ↗ · 2026-09-11 缓存

NInfer Studio 是一个原生的 Linux 和 Windows 桌面应用,用于 NInfer 本地 LLM 推理引擎,提供全面的界面,用于引擎配置、模型管理、流式聊天和智能编码工具。

0 人收藏 0 人点赞
#nvidia-gpu

Mercury 2.5

Hacker News Top ↗ · 2026-09-08 缓存

Inception Labs 推出了 Mercury 2.5,这是一款基于扩散技术的语言模型,在智能、速度和成本效益方面均有提升,适用于搜索、语音和编程等生产环境。

0 人收藏 0 人点赞
#nvidia-gpu

@StefanoErmon: 今天我们很高兴宣布 Mercury 2.5。它是目前市场上最强大的扩散大语言模型。它是智能方面40%的飞跃…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

Mercury 2.5 被宣布为最强大的扩散语言模型,智能方面比 Mercury 2 提升 40%,在 NVIDIA GPU 上运行速度超过每秒 1,100 个令牌,并针对生产进行了优化,具有低延迟和低成本。

0 人收藏 0 人点赞
#nvidia-gpu

短缺情况是否正在改善?

Reddit r/LocalLLaMA ↗ · 2026-09-03

作者在一家Microcenter商店观察到高端GPU如5090和Pro 6000的库存增加,表明短缺可能正在改善,尽管价格仍然很高。

0 人收藏 0 人点赞
#nvidia-gpu

Etched Sohu 对比 Nvidia:Transformer ASIC 对比 GPU(2026)

Hacker News Top ↗ · 2026-08-23 缓存

本文对比了 Etched Sohu Transformer ASIC 与 Nvidia GPU,讨论了其架构、性能声明以及对于AI推理硬件的实际意义。此外,文章还涵盖了 Etched 的隐秘退出、融资和合同细节。

0 人收藏 0 人点赞
#nvidia-gpu

@servasyy_ai: https://x.com/servasyy_ai/status/2091416214283379123

X AI KOLs Timeline ↗ · 2026-08-23 缓存

本文详细介绍了Qwen3.8 27B模型的本地部署指南,覆盖Mac和Nvidia显卡的两条路线,并提供实测性能数据,帮助用户在消费级硬件上运行该模型。

0 人收藏 0 人点赞
#nvidia-gpu

Qwen3.8-27B Q6 在代理编码方面是性能怪兽

Reddit r/LocalLLaMA ↗ · 2026-08-21

用户反馈显示,Qwen3.8-27B Q6 在代理编码任务中表现出高性能,在双 NVIDIA GPU 上持续运行 20 小时,保持 60-63 tokens/s 的速度。

0 人收藏 0 人点赞
#nvidia-gpu

@TheAhmadOsman: 顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行。

X AI KOLs Following ↗ · 2026-08-14 缓存

Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。

0 人收藏 0 人点赞
#nvidia-gpu

@tom_doerr:最高可达384GB VRAM的个人AI计算机搭建指南 https://github.com/autonomous-ai/autonomous-computer…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

开源的个人AI计算机搭建指南,最高支持384GB VRAM,配置涵盖家庭环境到企业内部部署。包含物料清单、组装照片以及本地运行开源AI模型的软件设置。

0 人收藏 0 人点赞
#nvidia-gpu

微软测试Phi Silica在Nvidia GPU上用于Windows AI(6分钟阅读)

TLDR AI ↗ · 2026-06-17 缓存

微软正在测试Phi Silica在Nvidia GPU上的支持,允许开发者在配备RTX 30系列或更新GPU的Windows设备上本地运行这一小型语言模型,不过缺少仅限NPU的功能,比如提示压缩。

0 人收藏 0 人点赞
#nvidia-gpu

谷歌每月向SpaceX支付9.2亿美元用于AI计算(4分钟阅读)

TLDR AI ↗ · 2026-06-08 缓存

谷歌将从2026年10月至2029年6月,每月向SpaceX支付9.2亿美元,获取约11万块NVIDIA GPU的AI计算能力,作为满足Gemini Enterprise需求的过渡方案,同时谷歌自身也在扩展AI基础设施。

0 人收藏 0 人点赞
#nvidia-gpu

Google将每月向SpaceX支付9.2亿美元以获取算力

TechCrunch AI ↗ · 2026-06-05 缓存

Google将从2026年10月至2029年6月每月向SpaceX支付9.2亿美元,以获取约11万块NVIDIA GPU及其他组件,这笔交易与SpaceX近期与Anthropic达成的协议类似。

0 人收藏 0 人点赞
#nvidia-gpu

nbd-vram:在Linux上使用NVIDIA GPU的显存作为交换空间

Lobsters Hottest ↗ · 2026-06-01 缓存

nbd-vram是一个Linux工具,通过NBD协议和CUDA使用NVIDIA GPU显存作为交换空间,为搭载焊接式内存且无法升级的系统提供额外内存。

0 人收藏 0 人点赞
#nvidia-gpu

本地压缩的助益

Reddit r/AI_Agents ↗ · 2026-05-22

一位用户分享了一个技巧:在代理工作流程中使用 Ollama 本地的 llama3.1:8b 模型压缩对话上下文,相较于将上下文发送给提供商,能降低延迟并减少 token 使用量。

0 人收藏 0 人点赞
#nvidia-gpu

构建9254修复了我的TG回归问题,并为NVIDIA GPU添加了PDL支持

Reddit r/LocalLLaMA ↗ · 2026-05-20

llama.cpp的构建9254修复了一个token生成回归问题,并添加了对NVIDIA GPU的PDL(程序化依赖启动)支持,在新硬件上token生成速度提升高达10%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈