local-inference

标签

Cards List
#local-inference

@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF

X AI KOLs Following · 2026-07-16 缓存

Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。

0 人收藏 0 人点赞
#local-inference

@MaziyarPanahi:我终于让GLM-5.2成功处理了一份整整三年的病历,这份病历之前只有Bonsai 27B有权读取其中的292条就诊记录…

X AI KOLs Timeline · 2026-07-15 缓存

@MaziyarPanahi在Mac Studio上使用llama.cpp本地运行GLM-5.2和Bonsai 27B处理一份三年的病历,发现了一个曾被标记但被忽略的危险药物相互作用。两个模型在Apache-2.0许可下完全在设备上运行,Bonsai在约2秒内回答查询,@PrismML声称一个1-bit构建可以装进iPhone。

0 人收藏 0 人点赞
#local-inference

@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…

X AI KOLs Following · 2026-07-14 缓存

腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。

0 人收藏 0 人点赞
#local-inference

Bonsai 27B:使用自定义WebGPU内核在浏览器中本地运行的1比特密集型大语言模型

Reddit r/LocalLLaMA · 2026-07-14

Bonsai 27B是一个1比特密集型大语言模型,通过使用自定义WebGPU内核可以在浏览器中本地运行,实现高效的设备端推理。

0 人收藏 0 人点赞
#local-inference

Spiritbuun 的 VBR(可变比特率)KV 缓存 —— 初印象

Reddit r/LocalLLaMA · 2026-07-14

一篇对 Spiritbuun 的 llama.cpp 分支的赞赏文章,重点介绍了其新的可变比特率(VBR)KV 缓存功能,该功能动态降低缓存精度以适应 VRAM,从而实现更大的自动适配上下文大小且速度损失极小。

0 人收藏 0 人点赞
#local-inference

MawForge:面向本地混合专家推理的内存受限专家物化

arXiv cs.LG · 2026-07-14 缓存

MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。

0 人收藏 0 人点赞
#local-inference

本地图像转3D(<2GB内存,<20秒,Apple Silicon,iPhone)

Reddit r/LocalLLaMA · 2026-07-12

一种新模型可在Apple Silicon设备和iPhone上本地从单张图像生成3D模型,内存占用低于2GB,耗时不到20秒。

0 人收藏 0 人点赞
#local-inference

我成功让 Nemotron Puzzle 75B 在 64GB M2 Max 上流畅运行

Reddit r/LocalLLaMA · 2026-07-12

成功在搭载 64GB 内存的 M2 Max Mac 上本地运行了 75B 参数的 Nemotron Puzzle 模型,展示了在消费级硬件上进行大规模模型推理的能力。

0 人收藏 0 人点赞
#local-inference

@insomnia_vip: 一位AI工程师花了数月时间构建了大多数人试图伪造的RAG堆栈。她发布了一个开源项目,该…

X AI KOLs Timeline · 2026-07-12 缓存

一位AI工程师发布了一个开源项目,教授如何从零构建本地RAG系统,以及一个生产级别的智能体架构,包含LangGraph、混合检索、缓存和可观测性。

0 人收藏 0 人点赞
#local-inference

@shaneparrish: https://x.com/shaneparrish/status/2075226155548807210

X AI KOLs Following · 2026-07-09 缓存

演示了在MacBook Pro上利用BBQ-FP4量化同时运行两个80B Qwen模型,声称性能无损且速度很快。

0 人收藏 0 人点赞
#local-inference

在4台GB10上运行GLM 5.2,配备100G交换机,330k上下文,~25 tok/s解码,~650 tok/s预填充

Reddit r/LocalLLaMA · 2026-07-08

本文详细介绍了在4台GB10的配置上,使用100G交换机运行GLM 5.2,在330k上下文下实现约25 tok/s解码和约650 tok/s预填充。内容包括硬件成本、使用Depth Prefill的性能基准测试,以及关于为更长上下文进行模型剪枝的说明。

0 人收藏 0 人点赞
#local-inference

@cline: Tencent Hy3 代表了开源智能领域的突破。它仅以295b参数/21b活跃参数就登顶基准测试…

X AI KOLs Following · 2026-07-07 缓存

Tencent Hy3 是一个新的开源前沿级AI模型,拥有2950亿参数(210亿活跃参数),在基准测试中名列前茅,并且可以在消费级硬件上本地运行。它在Cline中免费提供。

0 人收藏 0 人点赞
#local-inference

构建了Kivarro,一款一体化的本地推理工作台。希望从真正在本地运行模型的人那里获得毫不留情的反馈。

Reddit r/LocalLLaMA · 2026-07-05

作者构建了Kivarro,一个一体化的本地推理工作台,并正在寻求来自本地运行模型用户的反馈。

0 人收藏 0 人点赞
#local-inference

在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文

Reddit r/LocalLLaMA · 2026-07-05

用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。

0 人收藏 0 人点赞
#local-inference

介绍 Laguna XS 2.1(5分钟阅读)

TLDR AI · 2026-07-03 缓存

Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。

0 人收藏 0 人点赞
#local-inference

llamacpp 补丁 - 在 RTX 5090 上本地运行 DeepSeek V4 Flash,支持完整 1M token 上下文

Reddit r/LocalLLaMA · 2026-07-02

描述了一个针对 llama.cpp 的补丁,为 DeepSeek V4 Flash 的上下文索引添加了 CUDA 支持,从而在 RTX 5090 上实现了完整 1M token 上下文,同时显著降低了显存占用并保持了高吞吐量。

0 人收藏 0 人点赞
#local-inference

@Jolyne_AI: GitHub 又一款本地跑 AI 模型的开源新工具:Shimmy,直指 Ollama 的痛点。 单文件仅 5MB,却能提供快速、稳定的本地推理,并带完整的 OpenAI 兼容 API,接入成本几乎为零。 它用 Rust 打底,把性能榨到极…

X AI KOLs Timeline · 2026-07-02 缓存

GitHub 上又一款开源工具 Shimmy,仅 5MB 单文件,用 Rust 编写,提供快速稳定的本地推理和完整的 OpenAI 兼容 API,直指 Ollama 的痛点,启动不到 100ms,内存占用约 50MB。

0 人收藏 0 人点赞
#local-inference

@PrajwalTomar_: 如果你整个AI堆栈都依赖一个美国模型,一夜之间就可能全部宕机。DeepSeek、Qwen、Kimi。它们不只是…

X AI KOLs Timeline · 2026-07-01 缓存

讨论依赖单一美国前沿AI模型的风险,主张使用DeepSeek和Qwen等中国替代品构建多元化堆栈,这些模型可本地运行且成本更低,能实现更好的韧性和数据隐私。

0 人收藏 0 人点赞
#local-inference

[audio.cpp] VibeVoice 1.5B 发布 — 90分钟播客在22.95分钟内完成,4.08倍实时速度,比Python基线快2.86倍(无量化)。原生C++/ggml

Reddit r/LocalLLaMA · 2026-07-01

VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。

0 人收藏 0 人点赞
#local-inference

@nickfrosst: 现在是个好日子提醒大家我们有一个Apache 2.0的编码模型,你可以在本地用20GB内存运行…

X AI KOLs Following · 2026-06-26 缓存

Cohere Labs发布North Mini Code,一个拥有300亿参数(30亿活跃)的开源编码模型,协议为Apache 2.0,针对代码生成和智能体任务优化,可通过4位量化在20GB内存的本地运行。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈