标签
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
该 Hugging Face 仓库提供了社区编译的 MiniMax H3(Hailuo 3.0)量化与剪枝权重,使得在拥有 16-24GB 显存的消费级 GPU 上能够进行本地文本/图像/音频到视频的生成。包含 INT4、INT8 和 NVFP4 变体,并附有硬件特定指南。
一个Hugging Face仓库,提供未经审查的Qwen3-VL-32B变体的ComfyUI safetensors检查点,包含BF16和INT8 ConvRot H3条件编码器以及可选的生成尾部。
该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。
本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。
提供 MiniMax-H3 模型的 GGUF 量化版本的 Hugging Face 仓库,用于 ComfyUI,包含目录结构和所需 VAE 的链接。
Documentation reference for MSLK 1.3.0, a library of fused GPU kernels for transformer workloads including attention, quantization, GEMM, and MoE routing, supporting CUDA and ROCm with PyTorch integration.
一篇技术文章警告不要对 DeepSeek V4 Flash 的 KV 缓存进行量化,与 Qwen 397B 相比,其在困惑度、KL 散度和 token 概率方面表现出显著的质量下降。
EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。
一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。
Brian Roemmele reports that DeepSeek V4 Flash (304B, 1M context) now runs locally on Apple Silicon via the ds4 engine, sharing GGUF quantized builds with a fresh imatrix. The Hugging Face repo provides installation instructions and notes that these files are ds4-specific, not for llama.cpp.
作者利用GPT-5.6在10小时内完成了一个ESP32-CAM上的车库门识别项目,涵盖数据收集、标注、训练、量化与部署,展示了AI在硬件开发中的自主能力,并分享了人机协作的经验。
一位开发者展示了 Mference,这是一个新的推理引擎,通过从 SSD 流式加载专家,仅用约 5.3GB 内存即可运行 MoE 模型(如 DeepSeek-V4-Flash),并配有原生 Mac 应用和兼容 OpenAI 的服务器。
TheTom releases an MLX quantized version of DeepSeek V4 Flash (284B MoE, 21B active) at 3.05 bpw, fitting in 101 GiB to run on 128GB Apple Silicon, with GGUF sibling also available.
此 Hugging Face 模型卡片介绍了 LiquidAI 的 LFM2.5-2.6B 模型(GGUF 量化格式),并提供了通过 llama.cpp、vLLM、Ollama 等工具在本地运行的说明。
Unsloth 发布了 DeepSeek-V4-Flash-0731 的 IQ3 GGUF 量化版本,支持通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理。
展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。
对 Unsloth AI 的回复,表达了对传闻中的 DeepSeek-V4-Flash 模型的兴奋,以及通过量化版本在本地运行它的可能性。
Unsloth 预告了即将在 Hugging Face 上发布的 DeepSeek V4 Flash GGUF 量化模型。
Introduces CACHE-UK, a stability-aware memory editing framework for sequentially updating quantized LLMs in finance, reducing knowledge degradation on 4-bit OpenLLaMA-3B while improving generalization rates on a UK financial corpus.