标签
Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。
作者表达了对即将推出的 Qwen 3.8 模型的期待,分享了他们使用 Qwen 3.6 27B 进行本地 LLM 的体验,并讨论了自托管 AI 取代基于订阅的前沿模型的潜力。
一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。
LabyrinthBench是一个本地化、无需裁判的LLM基准测试,能够确定性地衡量多步骤智能体任务中干扰下的上下文记忆。初步实验表明,清空上下文并重新注入门控答案对9个模型中的7个有帮助,但对2个适得其反,凸显了上下文管理策略的复杂性。
Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。
Olares 是一个来自 beclab 团队的开源个人云操作系统,基于 Kubernetes,专为全天候 7x24 小时在线的 AI Agent 设计,可将旧电脑或 NAS 改装成自托管 AI 平台,支持本地数据存储和自然语言操作。
用户询问通过 Colibri 运行 Deepseek V4 Flash 的性能数据,重点关注高 VRAM 配置、长上下文预填充以及面向智能体工作负载的 token 生成速度。
介绍 GraphARC,一个 MIT 许可的开源工具,允许模型在运行时编写智能体图拓扑,并配备确定性的准入门以确保可审计的执行,基于 LangGraph 构建,可通过 ollama 在本地运行或对接云 API。
Ferrox 是一个纯 Rust 推理引擎,可加载 GGUF 模型,并在 CPU、Metal 或 CUDA 上运行本地 LLM,提供 CLI 和兼容 OpenAI 的服务器。它的目标是在不使用任何绑定、从零编写的情况下,达到与 llama.cpp 相当的性能。
一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
作者让 Claude Fable 5 和本地运行的 DeepSeek V4 Flash 下国际象棋,结果 DeepSeek 在长思考下每步消耗数万 token 甚至超时,但局面反而占优,一局耗时 5 小时尚未结束。
一位用户报告称,DeepSeek V4 Flash 以 2-bit 量化 GGUF 形式在双 RTX 3080 上运行,是首个在真实世界 SQL 基准测试中取得 100% 得分的本地模型,与 Opus 4.7 和 GPT-5.5 等前沿模型持平。
关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。
Homebench 是一款零配置终端工具,可对本地运行的LLM进行速度、内存和质量的基准测试,并提供实时排行榜。它支持 Ollama、LM Studio、llama.cpp、vLLM 以及兼容 OpenAI 的服务器。
LM Studio 用户担心,该公司正在弱化其原有的本地 LLM 应用,将关注点和下载入口转向新的 Bionic 代理,而主应用更新寥寥,且在网站上更难找到。
atomic.chat 的一项测试显示,Qwen 3.8 Max 在生成自包含的3D物理场景方面胜过 Fable 5,而每次运行成本约为其1/7。
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
一位开发者热情推荐 KAT Coder 2.5 dev,称其比 Qwen 3.6 35b a3b 更快、更准确、使用更少的 token,并且在他们的设置上优于 Gemma 4 模型,同时附有包含详细基准测试的 GitHub 仓库。
阿里巴巴宣布 Qwen3.8-27B 开源权重版本发布,可在 17GB RAM/VRAM 上本地运行,同时还有更大的 Qwen3.8-Max。