标签
本地部署大模型受限于硬件吞吐量,即使显卡性能满载,一天仅能处理约8.64M Token,不足以支持Agent自动化集群或大规模数据分析,因此规模化应用仍需依赖云端API。
文章分析了前沿AI模型与能在消费级硬件上运行的等效模型之间时间差不断缩小的趋势,基于近期发展预测,约300亿参数的'Mythos'模型最早可能在2027年1月实现本地部署。
一个团队开发了一个平台,允许用户微调和部署小型语言模型,并提供无限API推理,利用他们自己的GPU进行高效训练和推理。
阿里巴巴发布了Qwen3.8-27B,这是一个用于本地部署的27B开放权重多模态模型,在SWE-bench Pro和OSWorld等编程基准测试中表现出前沿级别的性能,超越了一些更大的模型。
Qwen3.8-27B 是一个拥有 270 亿参数、开放权重的 AI 模型,性能匹敌 Opus 4.6 Max,并且可以在笔记本电脑上本地运行。
NVIDIA 发布 Nemotron 3.5 Lightning 30B 模型,总参数30B,激活仅3B,支持100万token上下文,可商用,本地部署友好,输出速度最高提升4倍。
发现 DeepSeek V4 flash 在 vLLM 本地部署中的 KV 缓存失效 Bug:切换 Session 后前缀缓存命中率为 0,导致重新 Prefill,耗时从约 1 秒暴涨到约 100 秒。根因疑为 vLLM 重用 free queue 块时调用 _maybe_evict_cached_block() 删除了缓存索引。
Meta超级智能实验室发布了Muse-Glimmer-30B,这是一个具有感知编码器的30B参数因果语言模型,针对消费级硬件上的自主智能体任务进行了优化,支持可靠的工具使用、多步推理和多模态输入。
本文在结构化基准上评估了九个开放权重的小型语言模型(参数量135M至3B),并证明参数高效微调显著提升了准确率,使其在结构化小众工作负载的本地部署中具备可行性。
Qwythos-9B 是一款基于 Qwen3.5-9B 底座、用 5 亿+ Claude Mythos 推理轨迹二次训练的 9B 超强推理模型,原生支持 1M 长上下文和工具调用,专为安全研究员本地部署设计,在 MMLU 和数学推理上大幅领先原版底座。
作者分享参与国内头部医院训练垂直医疗模型的个人观点,指出医疗数据不出医院、本地化部署成本高、付费意愿弱等核心挑战,并建议与硬件厂商绑定。同时认为通用医疗模型(如百川)已表现良好。
强调开源AI模型对于特定领域任务、本地部署和持续改进的重要性,主张拥有智能而不是租赁智能。
Anthropic 发布了 Claude Science,一个面向科学家的 AI 工作台,内置 60 多个科研技能,支持本地部署和 HPC 集群,可自主起草计算任务并审查结果。
在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。
本文深入探讨了AI Agent的记忆架构,以Hermes四层记忆模型为例,分析了Claude Code记忆系统的局限性,并介绍了如何通过开源框架(如EverOS)为Agent增添本地记忆能力,提供了详细部署步骤。
Community efforts, including a hybrid quantization approach by dnhkng, have enabled vLLM and SGLang to support GLM-5.2 with MTP heads, boosting local inference speed from 2 token/s to over 43 token/s on dual GH200 hardware. The challenge involved managing DSA-based MTP and quantization compatibility.
一条推荐文章的帖子,涵盖了在家本地运行大语言模型并保持对自己AI所有权所需了解的一切。
GLM 5.2 是一个前沿的开源编程模型,在编程任务上的表现接近 Claude Opus,具备出色的工具调用、规划和本地部署能力,且完全免费。
现在可以使用 Google Gemma 开放模型直接在笔记本电脑上部署本地编码代理,实现离线执行和更快的开发工作流程。