标签
一篇对 Spiritbuun 的 llama.cpp 分支的赞赏文章,重点介绍了其新的可变比特率(VBR)KV 缓存功能,该功能动态降低缓存精度以适应 VRAM,从而实现更大的自动适配上下文大小且速度损失极小。
MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。
一种新模型可在Apple Silicon设备和iPhone上本地从单张图像生成3D模型,内存占用低于2GB,耗时不到20秒。
成功在搭载 64GB 内存的 M2 Max Mac 上本地运行了 75B 参数的 Nemotron Puzzle 模型,展示了在消费级硬件上进行大规模模型推理的能力。
一位AI工程师发布了一个开源项目,教授如何从零构建本地RAG系统,以及一个生产级别的智能体架构,包含LangGraph、混合检索、缓存和可观测性。
演示了在MacBook Pro上利用BBQ-FP4量化同时运行两个80B Qwen模型,声称性能无损且速度很快。
本文详细介绍了在4台GB10的配置上,使用100G交换机运行GLM 5.2,在330k上下文下实现约25 tok/s解码和约650 tok/s预填充。内容包括硬件成本、使用Depth Prefill的性能基准测试,以及关于为更长上下文进行模型剪枝的说明。
Tencent Hy3 是一个新的开源前沿级AI模型,拥有2950亿参数(210亿活跃参数),在基准测试中名列前茅,并且可以在消费级硬件上本地运行。它在Cline中免费提供。
作者构建了Kivarro,一个一体化的本地推理工作台,并正在寻求来自本地运行模型用户的反馈。
用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。
Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。
描述了一个针对 llama.cpp 的补丁,为 DeepSeek V4 Flash 的上下文索引添加了 CUDA 支持,从而在 RTX 5090 上实现了完整 1M token 上下文,同时显著降低了显存占用并保持了高吞吐量。
GitHub 上又一款开源工具 Shimmy,仅 5MB 单文件,用 Rust 编写,提供快速稳定的本地推理和完整的 OpenAI 兼容 API,直指 Ollama 的痛点,启动不到 100ms,内存占用约 50MB。
讨论依赖单一美国前沿AI模型的风险,主张使用DeepSeek和Qwen等中国替代品构建多元化堆栈,这些模型可本地运行且成本更低,能实现更好的韧性和数据隐私。
VibeVoice 1.5B,一个长篇幅多说话人TTS模型,现已获得audio.cpp(原生C++/ggml运行时)的支持,在RTX 5090上实现4.08倍实时速度,比无量化的Python基线快2.86倍。
Cohere Labs发布North Mini Code,一个拥有300亿参数(30亿活跃)的开源编码模型,协议为Apache 2.0,针对代码生成和智能体任务优化,可通过4位量化在20GB内存的本地运行。
宣布Ornith-1.0-35B,一个Qwen3.6-35B-A3B的编码微调版本,在aider基准测试上略优于基础模型。同时推广用于在RTX 3090上运行LLM的club-3090仓库。
发布了 Inflect-Nano-v2,这是一个固定语音的英文TTS模型,参数量低于4M,用于本地文本到波形合成,支持CPU或CUDA推理,以及长文本处理。
本文评测了在双Strix Halo(256GB显存)上运行GLM 5.2(IQ2M量化版本)的性能,生成速度仅约7 token/s,编码任务耗时是DeepSeek V4 Flash的两倍,性价比远不如其他模型,因此不建议在此硬件配置下使用。
Stable Diffusion XL (SDXL) 现在可以使用 WebGPU 在浏览器中本地运行,通过开源代码直接在设备上生成高质量 AI 图像。