标签
在单张 RTX 5090 GPU 上使用 Qwen3.8:27b 模型,达到每秒 85.6 token 的性能。
本文介绍了一个针对NVIDIA Ampere架构GPU(如3090)优化的llama.cpp自定义分支,能够在大上下文窗口下为27B参数模型实现每秒超过90个令牌的速度,使得本地推理速度快于API速度。
Kanverse GPU Borrow 是一款产品,允许设备在用户明确授权下,通过 Blink Bridge 临时借用其他机器的GPU计算资源,并由 GPT-6 Astra 编排。
NInfer Studio 是一个原生的 Linux 和 Windows 桌面应用,用于 NInfer 本地 LLM 推理引擎,提供全面的界面,用于引擎配置、模型管理、流式聊天和智能编码工具。
Inception Labs 推出了 Mercury 2.5,这是一款基于扩散技术的语言模型,在智能、速度和成本效益方面均有提升,适用于搜索、语音和编程等生产环境。
Mercury 2.5 被宣布为最强大的扩散语言模型,智能方面比 Mercury 2 提升 40%,在 NVIDIA GPU 上运行速度超过每秒 1,100 个令牌,并针对生产进行了优化,具有低延迟和低成本。
作者在一家Microcenter商店观察到高端GPU如5090和Pro 6000的库存增加,表明短缺可能正在改善,尽管价格仍然很高。
本文对比了 Etched Sohu Transformer ASIC 与 Nvidia GPU,讨论了其架构、性能声明以及对于AI推理硬件的实际意义。此外,文章还涵盖了 Etched 的隐秘退出、融资和合同细节。
本文详细介绍了Qwen3.8 27B模型的本地部署指南,覆盖Mac和Nvidia显卡的两条路线,并提供实测性能数据,帮助用户在消费级硬件上运行该模型。
用户反馈显示,Qwen3.8-27B Q6 在代理编码任务中表现出高性能,在双 NVIDIA GPU 上持续运行 20 小时,保持 60-63 tokens/s 的速度。
Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。
开源的个人AI计算机搭建指南,最高支持384GB VRAM,配置涵盖家庭环境到企业内部部署。包含物料清单、组装照片以及本地运行开源AI模型的软件设置。
微软正在测试Phi Silica在Nvidia GPU上的支持,允许开发者在配备RTX 30系列或更新GPU的Windows设备上本地运行这一小型语言模型,不过缺少仅限NPU的功能,比如提示压缩。
谷歌将从2026年10月至2029年6月,每月向SpaceX支付9.2亿美元,获取约11万块NVIDIA GPU的AI计算能力,作为满足Gemini Enterprise需求的过渡方案,同时谷歌自身也在扩展AI基础设施。
Google将从2026年10月至2029年6月每月向SpaceX支付9.2亿美元,以获取约11万块NVIDIA GPU及其他组件,这笔交易与SpaceX近期与Anthropic达成的协议类似。
nbd-vram是一个Linux工具,通过NBD协议和CUDA使用NVIDIA GPU显存作为交换空间,为搭载焊接式内存且无法升级的系统提供额外内存。
一位用户分享了一个技巧:在代理工作流程中使用 Ollama 本地的 llama3.1:8b 模型压缩对话上下文,相较于将上下文发送给提供商,能降低延迟并减少 token 使用量。
llama.cpp的构建9254修复了一个token生成回归问题,并添加了对NVIDIA GPU的PDL(程序化依赖启动)支持,在新硬件上token生成速度提升高达10%。