local-inference

标签

Cards List
#local-inference

你准备好迎接 Le Chaton FAT 了吗?还是继续在 GPU 上浪费钱?

Reddit r/LocalLLaMA · 2026-08-02

作者分享了为本地 AI 推理优化的存储服务器构建,该构建面向传闻中的 26T-a3b 模型“Le Chaton FAT”,并使用高容量 NVMe 驱动器配合 ZFS 来存储模型。

0 人收藏 0 人点赞
#local-inference

@BrianRoemmele: Another day and another full frontier model running on your computer. Been teething DeepSeek V4 Flash on over 60 employ…

X AI KOLs Timeline · 2026-08-02 缓存

Brian Roemmele reports that DeepSeek V4 Flash (304B, 1M context) now runs locally on Apple Silicon via the ds4 engine, sharing GGUF quantized builds with a fresh imatrix. The Hugging Face repo provides installation instructions and notes that these files are ds4-specific, not for llama.cpp.

0 人收藏 0 人点赞
#local-inference

huihui-ai/Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF

Hugging Face Models Trending · 2026-08-02 缓存

这是 Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF 的模型卡,它是 DeepSeek-V4-Flash 的 abliterated(无审查)GGUF 量化变体,专为与 llama.cpp 和 ds4 一起本地使用而设计。

0 人收藏 0 人点赞
#local-inference

搭建16xGB10(DGX Spark)集群

Reddit r/LocalLLaMA · 2026-08-02

用户正在搭建一个16节点的DGX Spark集群,以便本地运行前沿开放模型,并讨论200与100 Gbit/s之间的网络权衡。

0 人收藏 0 人点赞
#local-inference

LiquidAI/LFM2.5-2.6B-GGUF

Hugging Face Models Trending · 2026-08-01 缓存

此 Hugging Face 模型卡片介绍了 LiquidAI 的 LFM2.5-2.6B 模型(GGUF 量化格式),并提供了通过 llama.cpp、vLLM、Ollama 等工具在本地运行的说明。

0 人收藏 0 人点赞
#local-inference

IQ3 DS 发布

Reddit r/LocalLLaMA · 2026-07-31 缓存

Unsloth 发布了 DeepSeek-V4-Flash-0731 的 IQ3 GGUF 量化版本,支持通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理。

0 人收藏 0 人点赞
#local-inference

WASTE 推理引擎(14 分钟阅读)

TLDR AI · 2026-07-31 缓存

WASTE 是一个开源推理引擎,通过将专家权重存储在 NVMe 上,运行比主机可用内存大得多的模型。它展示了在配备 64GB 统一内存的 MacBook Pro 上运行 Kimi K3(一个 2.78T 参数的 MoE 模型)的能力。

0 人收藏 0 人点赞
#local-inference

Escha-W2 (Hugging Face 仓库)

TLDR AI · 2026-07-30 缓存

Escha-W2 是 Qwen3.6-35B-A3B MoE 模型的 2 位量化版本,打包了运行时,可通过兼容 OpenAI 的 API 进行本地部署。它需要 24 GB 显存的 GPU(16 GB 也可,但需权衡),可在 Hugging Face 上获取。

0 人收藏 0 人点赞
#local-inference

本地运行K3的可行方案

Reddit r/LocalLLaMA · 2026-07-27

讨论在本地运行Kimi K3 AI模型的低成本可行硬件配置方案。

0 人收藏 0 人点赞
#local-inference

Minimax-M3 的视觉支持已合并到 llama.cpp

Reddit r/LocalLLaMA · 2026-07-26 缓存

Minimax-M3 模型的视觉支持已合并到 llama.cpp 项目,使得该模型可以在本地进行多模态推理。

0 人收藏 0 人点赞
#local-inference

[开源] 仅通过本地推理才能实现的核心用例:设备端大语言模型理解您的全部生活,然后主动提供通过计算机操作来完成您的工作!开源且免费 :D

Reddit r/LocalLLaMA · 2026-07-26

一个开源、设备端的大语言模型,它理解您的全部生活,并主动提供通过计算机操作完成您的工作,从而实现仅通过本地推理才能实现的用例。

0 人收藏 0 人点赞
#local-inference

在本地定期使用Bonsai 27b 1b量化版

Reddit r/LocalLLaMA · 2026-07-24

一位用户分享了在16GB MacBook Air上本地使用Bonsai 27b的1-bit量化版进行日常聊天、辅导Go语言以及分析个人笔记的积极体验,称赞其智能性和小巧的体积。

0 人收藏 0 人点赞
#local-inference

在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)

Reddit r/LocalLLaMA · 2026-07-23

演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。

0 人收藏 0 人点赞
#local-inference

Deepseek V4 Flash 在两块 Nvidia 4090d 48G (ada) 上以 vLLM 运行,速度约 105 t/s

Reddit r/LocalLLaMA · 2026-07-23

技术文章:详细介绍如何使用自定义Triton内核和vLLM在两块Nvidia 4090d GPU上运行DeepSeek V4 Flash,在262k上下文环境下实现约105 tokens/秒的推理速度。

0 人收藏 0 人点赞
#local-inference

Laguna-S-2.1 运行在我6年前的旧游戏电脑上!

Reddit r/LocalLLaMA · 2026-07-22

Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。

0 人收藏 0 人点赞
#local-inference

@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……

X AI KOLs Timeline · 2026-07-20 缓存

百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。

0 人收藏 0 人点赞
#local-inference

@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF

X AI KOLs Following · 2026-07-16 缓存

Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。

0 人收藏 0 人点赞
#local-inference

@MaziyarPanahi:我终于让GLM-5.2成功处理了一份整整三年的病历,这份病历之前只有Bonsai 27B有权读取其中的292条就诊记录…

X AI KOLs Timeline · 2026-07-15 缓存

@MaziyarPanahi在Mac Studio上使用llama.cpp本地运行GLM-5.2和Bonsai 27B处理一份三年的病历,发现了一个曾被标记但被忽略的危险药物相互作用。两个模型在Apache-2.0许可下完全在设备上运行,Bonsai在约2秒内回答查询,@PrismML声称一个1-bit构建可以装进iPhone。

0 人收藏 0 人点赞
#local-inference

@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…

X AI KOLs Following · 2026-07-14 缓存

腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。

0 人收藏 0 人点赞
#local-inference

Bonsai 27B:使用自定义WebGPU内核在浏览器中本地运行的1比特密集型大语言模型

Reddit r/LocalLLaMA · 2026-07-14

Bonsai 27B是一个1比特密集型大语言模型,通过使用自定义WebGPU内核可以在浏览器中本地运行,实现高效的设备端推理。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈