标签
本文在结构化基准上评估了九个开放权重的小型语言模型(参数量135M至3B),并证明参数高效微调显著提升了准确率,使其在结构化小众工作负载的本地部署中具备可行性。
Qwythos-9B 是一款基于 Qwen3.5-9B 底座、用 5 亿+ Claude Mythos 推理轨迹二次训练的 9B 超强推理模型,原生支持 1M 长上下文和工具调用,专为安全研究员本地部署设计,在 MMLU 和数学推理上大幅领先原版底座。
作者分享参与国内头部医院训练垂直医疗模型的个人观点,指出医疗数据不出医院、本地化部署成本高、付费意愿弱等核心挑战,并建议与硬件厂商绑定。同时认为通用医疗模型(如百川)已表现良好。
强调开源AI模型对于特定领域任务、本地部署和持续改进的重要性,主张拥有智能而不是租赁智能。
Anthropic 发布了 Claude Science,一个面向科学家的 AI 工作台,内置 60 多个科研技能,支持本地部署和 HPC 集群,可自主起草计算任务并审查结果。
在 Hugging Face 上发布,Qwopus-3.6-35B-A3B-Coder 是一个经过微调的混合专家(MoE)编码代理模型,专为高效、低延迟的本地执行而设计,可在代理工作流中减少 token 浪费。
本文深入探讨了AI Agent的记忆架构,以Hermes四层记忆模型为例,分析了Claude Code记忆系统的局限性,并介绍了如何通过开源框架(如EverOS)为Agent增添本地记忆能力,提供了详细部署步骤。
Community efforts, including a hybrid quantization approach by dnhkng, have enabled vLLM and SGLang to support GLM-5.2 with MTP heads, boosting local inference speed from 2 token/s to over 43 token/s on dual GH200 hardware. The challenge involved managing DSA-based MTP and quantization compatibility.
一条推荐文章的帖子,涵盖了在家本地运行大语言模型并保持对自己AI所有权所需了解的一切。
GLM 5.2 是一个前沿的开源编程模型,在编程任务上的表现接近 Claude Opus,具备出色的工具调用、规划和本地部署能力,且完全免费。
现在可以使用 Google Gemma 开放模型直接在笔记本电脑上部署本地编码代理,实现离线执行和更快的开发工作流程。
本文提出了一种用于教育对话去标识化的全本地AI级联框架,结合了先召回候选生成器与上下文感知的移除/保留评审器。该方法在不将数据发送到外部API的情况下实现了高精度,在数学辅导记录上优于更小的本地模型和商业API。
作者实测了PP-OCRv6三档模型并提供了本地部署的开源工具,展示了在OmniDocBench及真实场景下各模型的性能对比,强调轻量专用模型在OCR任务上的优势。
百度文心发布 PP-OCRv6,提供 Tiny/Small/Medium 三档模型,支持 50 多种语言;其中 Tiny 版仅 1.5MB 可在浏览器本地运行,单图预测最快 97ms,证明小型专用模型可在 OCR 任务上超越大模型。
微软推出 Fara-7B,一款仅 7B 参数的高效 Computer Use Agent,在网页任务上超越更大模型,支持纯本地部署,低成本实现桌面自动化。
MiniMax-M3 PRISM Dynamic-Quant 配方通过逐张量敏感性排序,将428B参数模型从约450GB压缩至119GB,并计划进一步剪枝至60-80GB,以便本地部署。
一款120亿参数的多模态模型开源发布,采用统一Transformer架构,仅需16GB内存即可运行,在多项基准测试中表现优异,支持256K上下文窗口和140多种语言。
H 公司发布了 Holo-3.1-35B-A3B-NVFP4,一款开源计算机使用模型,在单个 DGX Spark 节点上可实现每秒高达 195 个 token 的推理速度,性能超越 Qwen3.5-397B 和 Kimi-K2.5 等更大模型。
一名开发者使用3台Mac Mini和9个AI代理搭建完全本地化的AI工作流,实现零云服务账单并月入1万美元。