标签
Unsloth 发布了 Qwen-Image-2.1 的 GGUF 量化版本,使其能够在12GB VRAM 上本地运行,性能与 Nano Banana 2.0 相当。
Unsloth AI 宣布对 GLM-5.3-Flash 进行优化,实现1.6–3.4倍更快的本地 GGUF 推理,支持多令牌预测和运行本地模型的硬件要求。
一名用户报告称,尽管事先精心规划且之前表现良好,Qwen3.8 27B模型在任务中产生了幻觉并实现了一个意外的功能。
Unsloth 宣布为新发布的 Qwen 3.8 Flash AI 模型提供 day 0 支持,提醒用户准备磁盘空间。
一位用户分享了在 Mac mini M4 上使用 Unsloth 的 Q3 XXS 量化版本运行 Qwen 27B 3.8 的积极体验,并询问他人对低于 Q3 量化版本的使用感受。
本文提供了 Qwen3.8-27B 模型的本地部署指南,推荐使用 Q4 量化和 Unsloth GGUF 工具,并分享了与 FP8 基准相比较的性能测试结果。
一位用户在8GB显存系统上测试了 unsloth 1位量化版本的 Qwen 3.8 27B AI模型,并发现结果很有趣。
Unsloth已发布适用于Qwen3.8模型的Dynamic v3.0 GGUFs,通过改进的量化技术和校准方法,在相同尺寸下提供超过10%的准确率提升。
Unsloth 发布了 Qwen3.8-27B AI 模型的 NVFP4 量化版本,该模型在编码、专业工作、智能体任务和原生视觉语言理解方面提供了增强的能力。
Unsloth 宣布 Qwen3.8 现在可以在本地运行,通过 Dynamic 1-bit 量化将 2.4T 参数模型从 4.9TB 缩小到 397GB,并提供了指南和 GGUF 版本。
Unsloth Desktop 是一款新的开源桌面应用,可在 Mac、Windows 和 Linux 上本地运行和训练模型,并支持将 Claude Code 和 Codex 连接到本地 LLM。
一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。
Unsloth 发布了 Meta 的 Muse Glimmer 30B 模型的 GGUF 量化版本,专为本地智能体任务设计,支持多模态输入、工具使用和多步推理。
Unsloth 发布了 Kimi K3 的新 GGUF 量化版本,大小从 466GB 到 649GB 不等,使大型模型能够高效部署。
Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,MiniMax-H3 是一个支持原生立体声音频的全模态视频生成系统,可通过 sd-cli 及其他平台进行本地执行。
Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。
Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。
阿里巴巴宣布 Qwen3.8-27B 开源权重版本发布,可在 17GB RAM/VRAM 上本地运行,同时还有更大的 Qwen3.8-Max。
Unsloth 发布了 DeepSeek-V4-Flash-0731 的 IQ3 GGUF 量化版本,支持通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理。
展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。