标签
Mike Bradley 分享了基准测试结果,声称 DeepSeek V4 Flash 0731 是当前190GB显存系统的最佳(SOTA)选择,在质量上匹敌甚至超过 Unsloth 3-bit Qwen3.5-397B,而运行速度大约快3倍。
这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。
一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。
TheTom releases an MLX quantized version of DeepSeek V4 Flash (284B MoE, 21B active) at 3.05 bpw, fitting in 101 GiB to run on 128GB Apple Silicon, with GGUF sibling also available.
对 Unsloth AI 的回复,表达了对传闻中的 DeepSeek-V4-Flash 模型的兴奋,以及通过量化版本在本地运行它的可能性。
一篇批判性分析,质疑作为守护的第二个本地LLM是否为代理系统创建了可靠的安全边界,主张采用确定性策略执行而非概率性护栏。
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
对 AI 进步迅速步伐的评论,指出像 Qwen3.6-27B 这样的开放权重模型现在已足够有竞争力,可以在消费级硬件上本地运行,而一年前 GPT-5 还是最好的之一。
一位Reddit用户分享了在小型本地LLM上测试成熟编排技术的结果,发现90%失败了,但幸存下来的10%在LFM 1.2B和Gemma 4 26B-A4B等模型上将任务完成率大约翻了一倍。
Hackster.io分享了一种在Raspberry Pi上无需Linux即可运行本地LLM的方法,实现裸机执行。
AutoDev Studio 是一款开源工具,允许在软件开发生命周期的不同阶段混合使用不同的AI模型,例如用本地LLM进行规划、用Claude Code进行实现、用不同的模型进行审查,同时以无头模式驱动工具。
一位智能手机电池评测员使用两个本地 LLM(Qwen3.6 模型),运行在高端 NVIDIA GPU 上,驱动一个视觉语言智能体,自主控制机械臂进行逼真的电池耗电测试,实现了低于两秒的延迟。
讨论本地 LLM 设备构建者是否会监控像 RTX 6000 Ada 这样的工作站 GPU 的价格,还是主要关注像 RTX 5090 这样的消费级显卡,以及是否存在针对这些不频繁但高风险的购买的专门跟踪工具。
用户报告在Jetson Orin NX 16GB边缘设备上成功运行了量化到1-bit的27B参数模型,对可行性表示惊讶。
一种名为'Extened Garlic'的技术使得在RTX 5060 Ti上以float8精度运行Qwen3.5 35B A3B模型达到55 tok/s的速度。
用户询问如何尝试Kimi K3本地大语言模型,指出自4.6+版本以来Claude的限制,并询问有哪些可用的服务或API来运行该模型。
一个新的GStreamer元素集成了llama.cpp,使得在多媒体管道中能够基于本地LLM进行文本翻译和转换,从而实现实时字幕生成和改写。
一篇批评性的博客文章,关于OpenCode这个开源的AI编码助手,详细描述了令人烦恼的设计缺陷和令人担忧的安全漏洞,这些漏洞可能导致被利用或数据丢失的风险。作者强烈建议不要使用它。
Qwythos-9B 是一款拥有 9B 参数、支持 1M 令牌上下文和原生工具调用的本地大语言模型,提供 GGUF 格式,适用于 Ollama、llama.cpp 和 LM Studio。其在关键基准测试中的表现显著超越其基础模型 Qwen3.5-9B。