标签
一位开发者通过在 4070 Ti + 32GB 内存上利用 GPT-OSS 120B 的 MoE 架构,将冷专家从 NVMe 流式加载、热专家缓存在 GPU 上,并采用 top-1 近似,最终达到了 21 tok/s 的本地运行速度。
一项本地实验,在代码维护任务上比较 Qwen 35B-A3B MoE 和 Qwen 27B dense,发现 MoE 模型速度快约 3.9 倍,且质量差距比预期更小。
技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。
Actual,一个低 CPU 影响的本地推理栈,现已原生支持 NousResearch 的 Hermes Agent,让用户可以从任何地方利用个人推理能力。
Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。
Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。
VibeVoice 1.5B 可在 iPhone 上本地运行,占用约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍;作者计划发布 audio.cpp 的 xcframework 和代码。
Liquid AI 发布了 LFM2.5-2.6B,这是一款紧凑的智能体模型,设计为完全在设备端运行,从而实现免费推理、低延迟和隐私保护。文章详细介绍了其训练流程,包括 SFT、教师特化、蒸馏和智能体强化学习。
详解如何在 RTX 4080 16GB 上通过 ComfyUI 原生工作流本地运行 MiniMax H3 视频生成模型,包含模型下载、目录配置、参数调优及常见坑点。
DeepSeek-V4-Flash-0731-GGUF 的 Hugging Face 页面,这是 DeepSeek V4 Flash 的 GGUF 量化版本,带有支持推理级别的更新模板,可直接用于 llama.cpp、vLLM、Ollama 及其他本地推理工具。
一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。
atomic.chat 发布了 DeepSeek V4 Flash 0731 的 14 个量化 GGUF 构建版本,从无损 BF16 到 1 位。他们推荐在 128GB 硬件上使用 AD-IQ2_M,该版本在 83.6% 的情况下与原始模型的 token 选择一致。
宣布 MiniMax H3 的 GGUF 量化版本现已可用,其中 Q2 版本仅有 8.49 GB,适合较低端的 GPU。
一位用户表达了对MinMax-H3的兴奋,强调现在可以100%本地实现这种视频质量。
DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。
该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。
Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。
一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。
作者分享了为本地 AI 推理优化的存储服务器构建,该构建面向传闻中的 26T-a3b 模型“Le Chaton FAT”,并使用高容量 NVMe 驱动器配合 ZFS 来存储模型。