@TheAhmadOsman: 天哪!27B模型低于6GB和4GB,本地AI将成为默认。附注:我们将尽快在ODS上由@OsmanticAI优化此功能…
摘要
Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。
查看缓存全文
缓存时间: 2026/07/14 22:33
天哪!!
27B模型可在6GB和4GB显存下运行
本地AI将成为常态
附注:我们即将在 @OsmanticAI 的ODS中优化此方案,尽快完成 https://t.co/cUJ2fIbQeB
PrismML (@PrismML): 这是 Ternary Bonsai 27B 在 NVIDIA GeForce RTX 5090 GPU 上本地运行端到端代理工作流的演示,采用 Hermes 模型。
该模型能够推理、调用工具、读取输出、修改文件并提炼洞见——全部在消费级硬件上完成,同时所有私有文件及中间状态均保持本地。
相似文章
在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难
作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。
@witcheer: 难以置信 gpt-oss-20b 在 8GB 显存上的表现。21B 总参数,3.6B 活跃参数(MoE)。OpenAI,Apache 2.0。仅使用 1.8 GB 显存…
一个全新的开源 MoE 模型,gpt-oss-20b(总共 21B,活跃 3.6B),仅需 1.8GB 显存即可运行,并在代理编程任务上获得满分,性能优于其他本地模型(如 Gemma 和 Qwen)。
@TheAhmadOsman: 本地AI现在很好了
Ahmad宣布了一个本地AI硬件竞技场,使用ODS在RTX PRO 6000、DGX Spark、Strix Halo、M5 MacBook Pro和ChatGPT等硬件上对LLM进行基准测试,并邀请社区为未来的比较提供意见。
@UnslothAI: GLM-5.2 现在可以本地运行!2-bit 模型在从 1.51TB 缩小到 238GB(-84% 大小)后保留了约 82% 的准确率…
UnslothAI 宣布 GLM-5.2,Z.ai 的最强开源模型,拥有 744B 参数,现在可以通过动态 GGUF 量化在本地运行,将大小减少约 84% 至 239GB,同时保留约 82% 的准确率。它适用于 256GB Mac 以及 RAM/VRAM 配置,并支持长上下文、推理和代理任务。
Bonsai 27B:使用自定义WebGPU内核在浏览器中本地运行的1比特密集型大语言模型
Bonsai 27B是一个1比特密集型大语言模型,通过使用自定义WebGPU内核可以在浏览器中本地运行,实现高效的设备端推理。