unsloth/inkling-GGUF

Hugging Face Models Trending 模型

摘要

unsloth/inkling-GGUF 页面提供了 Inkling 的量化 GGUF 版本。Inkling 是 Thinking Machines 开发的一个 975B 参数的多模态 MoE 模型(41B 活跃),设计用于文本、图像和音频输入,拥有开放权重,并支持通过 Unsloth、SGLang 和 vLLM 等库进行本地部署。

任务:图片-文本到文本 标签:gguf, 对话, 图片-文本到文本, 音频-文本到文本, moe, unsloth, inkling_mm_model, 基础模型:thinkingmachines/Inkling, 基础模型(量化):thinkingmachines/Inkling, 许可证:apache-2.0, 兼容端点, 区域:us
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:32

unsloth/inkling-GGUF · Hugging Face

来源:https://huggingface.co/unsloth/inkling-GGUF

阅读我们的如何运行 Inkling 指南!(https://unsloth.ai/docs/models/inkling)

Unsloth Studio 中的 Inkling


BF16 (https://huggingface.co/thinkingmachines/Inkling) | NVFP4 (https://huggingface.co/thinkingmachines/Inkling-NVFP4) | Tinker Cookbook (https://github.com/thinking-machines-lab/tinker-cookbook) | 文档 (https://tinker-docs.thinkingmachines.ai/cookbook/inkling/) | 可接受使用政策 (https://thinkingmachines.ai/model-acceptable-use-policy)

1. 基本信息

Inkling 是一款通用多模态模型,可接受文本、图像和音频输入,并生成文本输出。该模型适用于英语及其他语言,以及多种编程语言。它专为构建 AI 驱动应用的开发者设计,包括智能体与工具调用系统、编程助手、聊天机器人和检索增强生成系统,并适用于通用对话、指令遵循及其他自然语言与多模态任务。模型以开放权重发布,以支持下游开发者进行研究、微调和集成到第三方产品中。

语言: 英语,并具备跨其他语言的通用多语言能力。

2. 快速入门

若要通过 Tinker 访问 Inkling,可参考 Tinker Cookbook (https://github.com/thinking-machines-lab/tinker-cookbook) 及相关文档 (https://tinker-docs.thinkingmachines.ai/cookbook/inkling/)。

Inkling 支持使用以下开源库进行本地部署:

  • SGLang (文档 (https://docs.sglang.io/cookbook/autoregressive/ThinkingMachines/Inkling),PR)
  • vLLM (文档 (https://recipes.vllm.ai/thinkingmachines/inkling),PR)
  • TokenSpeed (文档 (https://lightseek.org/tokenspeed/recipes/models#Inkling),PR)
  • Unsloth (文档 (https://unsloth.ai/docs/models/inkling),PR)
  • Huggingface (文档,PR)

此外,也可通过第三方推理提供商获取 API 访问。

3. 模型属性

模型类型

多模态自回归 Transformer

架构类型

66 层仅解码器 Transformer,采用稀疏混合专家(MoE)前馈骨干:每个 token 路由到 256 个专家中的 6 个,外加 2 个在每个 token 上激活的共享专家。注意力机制为局部层与全局层的混合。模型原生支持多模态——图像和视频通过分层补丁编码器编码,音频通过离散 token 编码——所有模态被投影到共享隐藏空间,并由解码器联合处理。

参数

总计 975B,激活 41B

数值格式支持

BF16 和 NVFP4

输入模态

Inkling 接受 UTF-8 编码的文本输入、任何基于像素格式的图像输入(为获得最佳性能,每边尺寸最好在 40px 到 4096px 之间),以及采样率为 16kHz 的 WAV 格式音频输入(为获得最佳性能,时长最好在 20 分钟以内)。

输出模态

Inkling 输出 UTF-8 编码的文本。

4. 训练

训练数据包含广泛的内容类型,包括文本、图像、音频、视频。模型的训练数据来自公开来源、从第三方获取,或通过合成生成或增强。公开数据包括公开互联网和可公开访问的存储库中的内容。

训练数据整理过程包括数据集的清洗、处理与修改。这些处理步骤因数据类型而异,可能包括去重和过滤以去除垃圾或低质量数据,或提升安全性或其他目标。

5. 评估

Inkling 的结果在 effort=0.99 时报告。对比分数来自 r/acc 排行榜,生成于 2026 年 7 月 14 日。Nemotron 3 Ultra、Kimi K2.5、Kimi K2.6、GLM 5.2 和 DeepSeek V4 Pro 为开放权重模型;Gemini 3.1 Pro、Claude Fable 5 和 GPT 5.6 Sol 为封闭权重模型。

InklingNemotron 3 UltraKimi K2.5Kimi K2.6GLM 5.2DeepSeek V4 ProGemini 3.1 Pro (high)Claude Fable 5 (max)GPT 5.6 Sol (xhigh)
推理
HLE (仅文本)30.0%26.6%29.4%35.9%40.1%35.9%44.7%53.3%47.2%
HLE (带工具)46.0%37.4%50.2%54.0%54.7%48.2%51.4%64.5%55.0%
AIME 202697.1%94.2%95.8%96.4%99.2%96.7%98.3%99.9%
GPQA Diamond87.9%86.7%87.9%91.1%89.5%88.8%94.1%92.6%94.1%
智能体 (编程)
SWEBench Verified77.6%70.7%76.8%80.2%80.6%80.6%95.0%
SWEBench Pro (Public)54.3%46.4%50.7%58.6%62.1%55.4%54.2%80.0%64.6%
Terminal Bench 2.1 (最佳框架)63.856.451.371.382.76473.884.689.5
GDPVal-AA v212331164100911901514130796217601748
智能体 (通用)
MCP Atlas74.1%44.7%64.0%68.1%77.8%73.2%78.2%83.3%81.8%
Tau 3 Banking22.3%13.8%13.2%20.6%26.8%25.8%16.5%26.8%33.0%
事实性
BrowseComp (w/ Ctx)77.1%74.9%83.2%83.4%85.9%88.0%89.4%
SimpleQA Verified43.9%32.4%36.9%38.7%38.1%57.0%77.3%68.3%71.6%
AA Omniscience1.0%-1.0%-8.0%6.0%4.0%-10.0%33.0%40.0%22.0%
聊天
IFBench79.8%81.4%70.2%76.0%73.3%76.5%77.1%63.5%72.7%
Global-MMLU-Lite88.7%85.6%84.0%88.4%89.2%89.3%92.7%93.3%91.8%
视觉
MMMU Pro (Standard 10)73.3%75.0%79.0%82.0%84.2%83.0%
Charxiv RQ78.1%77.5%80.4%80.2%86.5%84.7%
Charxiv RQ (带 python)82.0%78.7%86.7%89.9%89.4%87.8%
音频
Audio MC56.6%66.8%
MMAU77.2%82.5%
VoiceBench91.4%94.3%
安全
FORTRESS (对抗性)78.0%77.6%54.1%65.6%71.3%36.0%65.2%96.0%82.4%
FORTRESS (良性)95.9%90.5%98.3%97.2%90.0%98.5%98.0%55.1%98.1%
StrongREJECT98.6%98.7%99.5%99.8%98.5%98.6%98.0%98.7%98.5%

6. 安全性

我们在发布前进行了安全评估,涵盖了日常人机交互与危险能力测试。由于 Inkling 是多模态的,我们关注了安全行为在文本、音频和图像输入上是否保持一致。我们在发布前采取了缓解措施以降低风险。

对于日常交互,我们评估了谄媚、有害操纵以及心理伤害模式(如类社交依赖和对妄想推理的验证),包括通过多轮、开放式外部红队测试来发现那些在较长对话中才暴露的问题。我们还评估了模型是否在拒绝真正有害请求的同时,避免过度拒绝良性请求。针对化学、生物、放射性和核(CBRN)以及网络安全领域,我们通过内部评估、外部测试以及抑制拒绝的变体来评估知识与程序提升,这些变体旨在估计移除防护后的潜在能力。对于失控风险,我们评估了智能体能力、战略欺骗和破坏潜力,并与公开前沿模型进行基准比较,发现该模型的能力在实质上低于前沿水平。

在所有领域中,我们得出结论:Inkling 并未带来超出开放权重生态系统已有能力的实质性提升。

我们的评估中识别出的残留风险——具体来说,Inkling 偶尔倾向于顺从角色扮演和涉及有害话题的间接框架提示——与其他任何开放权重模型的表现一致,最好通过深度防御来应对,而不是仅仅依赖模型的拒绝机制。常见的下游审核工具(如 Llama Guard)与 Inkling 兼容,可围绕模型部署以捕获越狱尝试、过滤不安全输出并实施针对用例的策略。我们鼓励将这种输入/输出分类视为部署栈的一部分,特别是在更可能遇到对抗性提示的面向消费者或高流量应用中。

7. 偏见、风险与局限

Inkling 可能表现出基础模型普遍存在的局限性,包括幻觉(生成貌似合理但事实不正确或无根据的内容)、偶尔未能精确遵循指令,以及在长多轮对话中性能下降。与其他基于网络数据和合成数据训练的大规模模型一样,Inkling 可能反映训练数据中存在的偏见,包括人口统计、文化或语言偏见,并且在训练中代表性不足的语言、方言或主题领域上表现可能不均。

Inkling 的知识限于其训练截止日期时可用的信息,可能无法反映之后发生的事件、发展或变化。

我们建议下游开发者和部署者在高风险或安全关键场景中对输出进行恰当的人工监督和审查,而不是不经验证地依赖 Inkling 的输出。

  • 在部署前,针对其特定用例、语言和人群自行评估 Inkling 的性能、安全性和公平性,特别是涉及弱势群体的应用。
  • 在应用层实施额外防护措施——如内容过滤、速率限制和监控——尤其是在开放部署环境中,Inkling 的内置缓解措施可能不足以单独发挥作用。
  • 避免在医疗、法律或安全关键决策等领域部署 Inkling,除非经过额外的微调、领域特定验证和人工监督。

相似文章

unsloth/MiniMax-M3-GGUF

Hugging Face Models Trending

Unsloth 发布了 MiniMax-M3 多模态模型的 GGUF 量化版本,支持图像-文本到文本任务,兼容 Transformers、llama.cpp、vLLM 等推理引擎。

unsloth/gemma-4-26B-A4B-it-GGUF

Hugging Face Models Trending

# unsloth/gemma-4-26B-A4B-it-GGUF · Hugging Face 来源:[https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF) ## [https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF#read-our-how-to-run-gemma-4-guide](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF#read-our-how-to-run-gemma-4-guide)阅读我们的[如何运行 Gemma 4 指南](https://docs.unsloth.ai/models/gemma-4)! *请参阅[Unsloth Dynamic 2.0 GGUFs](https://unsloth.ai/docs/basics/unslot

huihui-ai/Huihui-GLM-5.2-abliterated-GGUF

Hugging Face Models Trending

Hugging Face 上发布了已消除限制的 GLM-5.2 模型的量化 GGUF 版本,可使用 Transformers、llama.cpp 和 vLLM 等工具进行本地推理。

unsloth/ERNIE-Image-Turbo-GGUF

Hugging Face Models Trending

unsloth 发布了基于百度的 ERNIE-Image-Turbo 模型的 GGUF 量化版本,采用 Unsloth Dynamic 2.0 方法,能够在配备 24GB 显存的消费级 GPU 上通过 8 步推理高效实现文生图。

unsloth/Muse-Glimmer-30B-GGUF · Hugging Face

Reddit r/LocalLLaMA

Unsloth 发布了 Meta 的 Muse Glimmer 30B 模型的 GGUF 量化版本,专为本地智能体任务设计,支持多模态输入、工具使用和多步推理。