@DJLougen:量化版本在此:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF…
摘要
GestaltLabs 发布了 Ornstein-3.5-9B-V1.5 GGUF 量化版本,这是基于 Qwen 3.5 9B 的推理优化微调模型,配备了 MTP 头和视觉投影器,支持多模态应用。
查看缓存全文
缓存时间: 2026/06/17 20:02
Quants 下载地址:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF…
GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF · Hugging Face
来源:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF Ornstein 3.5 9B — V1.5(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF/blob/main/ornstein3.5-9bv1.5.png)
这是 GestaltLabs/Ornstein-3.5-9B-V1.5(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5)的 GGUF 量化版本——该模型是基于 Qwen 3.5 9B 进行推理优化的微调版本,专注于 AI 研究和技术问题解决,也是 V1 与即将推出的 V2(一个更严格的后训练版本,涉及强化学习方法)之间的中间版本(V1.5)。
这些构建保留了模型原生的多 token 预测(MTP)头(用于兼容运行时的推测解码),并附带了独立的视觉投影器(mmproj),使多模态部分可用于图像/视频输入。
文件(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#files)
| 文件 | 大小 | 说明 |
|---|---|---|
Ornstein-3.5-9B-V1.5-Q8_0.gguf | 8.9 GB | 近乎无损 |
Ornstein-3.5-9B-V1.5-Q6_K.gguf | 6.7 GB | 极高品质 |
Ornstein-3.5-9B-V1.5-Q5_K_M.gguf | 5.6 GB | 高品质 |
Ornstein-3.5-9B-V1.5-Q4_K_M.gguf | 4.5 GB | 推荐默认 |
Ornstein-3.5-9B-V1.5-Q3_K_M.gguf | 3.4 GB | 最小 |
mmproj-Ornstein-3.5-9B-V1.5-f16.gguf | f16 | 0.9 GB — 视觉编码器,可与任意量化版本搭配用于图像/视频 |
使用方法(llama.cpp)
文本模式:
llama-cli -hf GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF:Q4_K_M -p "推导两个相关随机变量之和的方差。"
多模态(图像/视频)——需添加视觉投影器:
llama-mtmd-cli -m Ornstein-3.5-9B-V1.5-Q4_K_M.gguf \
--mmproj mmproj-Ornstein-3.5-9B-V1.5-f16.gguf \
--image picture.jpg -p "描述这张图片。"
品质和速度随量化大小变化;Q4_K_M 是约 8 GB 显存/内存的推荐默认选项。MTP 头可在支持的环境中启用推测解码。
亮点(全精度模型)(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#highlights-full-precision-model)
- 相比基础模型,多步推理能力显著提升,在困难的、研究生级别的科学推理上改进最大。
- 通用对话能力得以保留。
支持本项目(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#support-this-work)
我是多伦多大学视觉神经科学专业的博士生,同时也热衷于在租用的 H100 和本地 DGX Spark 上对开放权重模型进行微调、合并和量化。所有训练计算均自费——在 GPU 成本和博士生预算之间艰难平衡。如果我的上传对你有帮助,可以考虑请博士生喝杯咖啡。这对我继续运行这些实验至关重要。
在 Ko-fi 上支持我(https://ko-fi.com/djlougen)
许可证(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#license)
Apache 2.0 —— 继承自 Qwen 3.5 9B 基础版发布版本。
相似文章
Qwen/Qwen3.6-27B-FP8
阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。
@Ex0byt: 各位,这是 Qwen3.6-27B-PRISM-PRO-DQ - 敬请享用!
发布了 Qwen3.6-27B-PRISM-PRO-DQ,这是 Qwen3.6-27B 的动态量化 GGUF 版本,去除了偏见/宣传内容,保留了原生 MTP 草稿头和视觉塔,支持无损推测解码以实现更快的推理。
KyleHessling1/Qwopus-GLM-18B-Merged-GGUF
实验性 18B 参数模型:将两个 Qwen-3.5-9B 微调模型堆叠后,用 1000 步 QLoRA“缝合”层边界;生成的 GGUF 在 44 项测试集上超越 Qwen 3.6-35B MoE,却只占 9.2 GB 显存。
hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF
一个 35B 参数的 Qwen3.6 模型,使用 Claude-Opus 风格的思维链蒸馏数据微调,并以 GGUF 量化格式发布,可在本地高效推理。
Qwen/Qwen3.6-35B-A3B-FP8
阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。