@DJLougen:量化版本在此:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF…

X AI KOLs Timeline 模型

摘要

GestaltLabs 发布了 Ornstein-3.5-9B-V1.5 GGUF 量化版本,这是基于 Qwen 3.5 9B 的推理优化微调模型,配备了 MTP 头和视觉投影器,支持多模态应用。

量化版本在此:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF…
查看原文
查看缓存全文

缓存时间: 2026/06/17 20:02

Quants 下载地址:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF…


GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF · Hugging Face

来源:https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF Ornstein 3.5 9B — V1.5(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF/blob/main/ornstein3.5-9bv1.5.png)

这是 GestaltLabs/Ornstein-3.5-9B-V1.5(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5)的 GGUF 量化版本——该模型是基于 Qwen 3.5 9B 进行推理优化的微调版本,专注于 AI 研究和技术问题解决,也是 V1 与即将推出的 V2(一个更严格的后训练版本,涉及强化学习方法)之间的中间版本(V1.5)。

这些构建保留了模型原生的多 token 预测(MTP)头(用于兼容运行时的推测解码),并附带了独立的视觉投影器mmproj),使多模态部分可用于图像/视频输入。

文件(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#files)

文件大小说明
Ornstein-3.5-9B-V1.5-Q8_0.gguf8.9 GB近乎无损
Ornstein-3.5-9B-V1.5-Q6_K.gguf6.7 GB极高品质
Ornstein-3.5-9B-V1.5-Q5_K_M.gguf5.6 GB高品质
Ornstein-3.5-9B-V1.5-Q4_K_M.gguf4.5 GB推荐默认
Ornstein-3.5-9B-V1.5-Q3_K_M.gguf3.4 GB最小
mmproj-Ornstein-3.5-9B-V1.5-f16.gguff160.9 GB — 视觉编码器,可与任意量化版本搭配用于图像/视频

使用方法(llama.cpp)

文本模式:

llama-cli -hf GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF:Q4_K_M -p "推导两个相关随机变量之和的方差。"

多模态(图像/视频)——需添加视觉投影器:

llama-mtmd-cli -m Ornstein-3.5-9B-V1.5-Q4_K_M.gguf \
  --mmproj mmproj-Ornstein-3.5-9B-V1.5-f16.gguf \
  --image picture.jpg -p "描述这张图片。"

品质和速度随量化大小变化;Q4_K_M 是约 8 GB 显存/内存的推荐默认选项。MTP 头可在支持的环境中启用推测解码。

亮点(全精度模型)(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#highlights-full-precision-model)

  • 相比基础模型,多步推理能力显著提升,在困难的、研究生级别的科学推理上改进最大。
  • 通用对话能力得以保留。

支持本项目(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#support-this-work)

我是多伦多大学视觉神经科学专业的博士生,同时也热衷于在租用的 H100 和本地 DGX Spark 上对开放权重模型进行微调、合并和量化。所有训练计算均自费——在 GPU 成本和博士生预算之间艰难平衡。如果我的上传对你有帮助,可以考虑请博士生喝杯咖啡。这对我继续运行这些实验至关重要。

在 Ko-fi 上支持我(https://ko-fi.com/djlougen)

许可证(https://huggingface.co/GestaltLabs/Ornstein-3.5-9B-V1.5-GGUF#license)

Apache 2.0 —— 继承自 Qwen 3.5 9B 基础版发布版本。

相似文章

Qwen/Qwen3.6-27B-FP8

Hugging Face Models Trending

阿里巴巴发布 Qwen3.6-27B-FP8,一款 27B 参数的 FP8 量化模型,在代理式编码与推理基准上表现强劲,现已上架 Hugging Face。

KyleHessling1/Qwopus-GLM-18B-Merged-GGUF

Hugging Face Models Trending

实验性 18B 参数模型:将两个 Qwen-3.5-9B 微调模型堆叠后,用 1000 步 QLoRA“缝合”层边界;生成的 GGUF 在 44 项测试集上超越 Qwen 3.6-35B MoE,却只占 9.2 GB 显存。

Qwen/Qwen3.6-35B-A3B-FP8

Hugging Face Models Trending

阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。