Inkling-Small(4分钟阅读)

TLDR AI 模型

摘要

Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。

Thinking Machines已发布Inkling-Small,这是一个拥有276B参数和12B激活参数的混合专家模型。该模型保留了Inkling的多模态推理、可变思考深度和100万token的上下文窗口,同时大幅减少了计算量。
查看原文
查看缓存全文

缓存时间: 2026/07/31 18:27

# 介绍 Inkling-Small 来源:https://thinkingmachines.ai/news/inkling-small/ 今天,我们发布 Inkling-Small,这是一个高效的开源权重模型,性能与 [Inkling](https://thinkingmachines.ai/news/introducing-inkling/) 相当,而体积仅为后者的四分之一。 Inkling-Small 是一个混合专家(MoE)Transformer 模型,总参数 276B,激活参数 12B,基于 NVIDIA GB300 NVL72 系统训练。与 Inkling 一样,它具备原生音频与图像推理能力、可变的思考强度、最高 1M token 的上下文窗口,以及在一系列基准上的全面均衡表现。 ### Inkling-Small 总参数 276B,激活参数 12B ### Inkling 总参数 975B,激活参数 41B Inkling-Small 与 Inkling 的参数对比。与 Inkling 相比,Inkling-Small 以更少的算力实现了相当的性能。在智能体工具使用(Terminal-Bench 2.1)、推理(HLE,纯文本、无工具)和指令跟随(IFBench)基准上,Inkling-Small 比 Inkling 更高效,并且与同量级的其他模型相比也很有竞争力。此外,它的[可变思考强度](https://thinkingmachines.ai/news/introducing-inkling/#controllable-thinking-effort)让用户可以轻松地针对自身用例进行调整,在成本与性能之间取得平衡。 Inkling-Small(12B 激活,思考强度扫描)|Inkling(41B 激活,思考强度扫描)|对比模型 性能-算力对比。将[推理强度](https://thinkingmachines.ai/news/introducing-inkling/#controllable-thinking-effort)从最低扫描到 xhigh([文档](https://tinker-docs.thinkingmachines.ai/cookbook/inkling/thinking-effort/)),描绘出 Inkling-Small 和 Inkling 在 Terminal-Bench 2.1、HLE(无工具)和 IFBench 上的性能-算力曲线(每个样本的输出 TFLOPs)。我们展示了 Inkling-Small 在相似规模的开源权重模型中,无论在性能还是效率上都具备竞争力。每个样本的输出 TFLOPs 估算为 2 × 激活参数 × 每个样本的平均生成 token 数,其中生成 token 数包含推理 token,来自我们自己的评估或 [Artificial Analysis](https://artificialanalysis.ai/evaluations/) 的公开报告。 我们发布了 Inkling-Small 的[完整权重](https://huggingface.co/thinkingmachines/Inkling-Small)。同时,它也已经在 Tinker 上开放微调,并可在 [Tinker Playground](https://tinker.thinkingmachines.ai/playground?utm_source=blog&utm_campaign=inkling_small_model_release) 上进行文本、图像和音频对话。 ## 能力 在构建模型家族的过程中,我们一直在迭代自己的方法。Inkling-Small 是在其更大版本之后开始训练的,这让我们得以改进训练流程。例如,我们调整了 Inkling-Small 的预训练数据配比和机器学习方案。此外,我们对一个更早的检查点 [Inkling-Small (preview)](https://thinkingmachines.ai/news/introducing-inkling/#inkling-small) 进行了后训练,其中部分采用了以 Inkling 为教师的在线策略蒸馏。从该检查点出发,我们又继续进行了两周的智能体编码强化学习。凭借这些改进,Inkling-Small 在推理和智能体编码基准上超越了 Inkling。Inkling 在知识覆盖和事实性方面仍然保持优势。 雷达图对比 Inkling-Small、Inkling、DeepSeek V4 Flash、Gemini 3.5 Flash-Lite 和 GPT 5.6 Luna 在十项评估上的得分,所有分数统一为 0 到 100。Inkling-Small 用实心紫色线表示,Inkling 用较粗的钴蓝色线表示,对比模型用虚线表示。未报告分数的评估按零分绘制。将鼠标悬停在某一项评估上,可以对比每个模型的得分。 Inkling-Small 是一个广泛而均衡的通才模型。基准分数统一采用 0–100 分制;分数越高越好。 ### 推理与智能体任务 Inkling-Small 在推理和智能体任务上与 Inkling 相当或更优。在 Humanity’s Last Exam 上,它取得了 31.6% 的成绩,领先于 Inkling 的 29.7%,而且在每个思考预算下这一优势都成立:Inkling-Small 的测试时算力曲线全程位于 Inkling 之上。在 SWEBench-Verified 上,它超过了 80%。 在许多推理和智能体基准上,与同量级的开源权重模型相比,Inkling-Small 在最大推理强度下有着很强的性能-token 权衡。 Inkling-Small|Inkling|对比模型|Pareto 前沿 GDPval-AA v2 (Elo):900/1100/1300/1500,15k/30k/60k - GDPval-AA v2 · Inkling-Small: 1269, 23k 输出 token/任务 - GDPval-AA v2 · Inkling: 1238, 28.6k 输出 token/任务 - GDPval-AA v2 · Nemotron 3 Ultra: 1164, 27.2k 输出 token/任务 - GDPval-AA v2 · DeepSeek V4 Flash: 1189, 28.2k 输出 token/任务 - GDPval-AA v2 · DeepSeek V4 Pro: 1306, 31.8k 输出 token/任务 - GDPval-AA v2 · Qwen3.5-397B-A17B: 962, 15.5k 输出 token/任务 - GDPval-AA v2 · MiMo V2.5: 1145, 16k 输出 token/任务 - GDPval-AA v2 · MiMo V2.5 Pro: 1265.1, 22.8k 输出 token/任务 - GDPval-AA v2 · Minimax M2.7: 1159, 24.1k 输出 token/任务 - GDPval-AA v2 · MiniMax M3: 1390.8, 43.1k 输出 token/任务 - GDPval-AA v2 · Kimi K2.5: 1009, 15.9k 输出 token/任务 - GDPval-AA v2 · Kimi K2.6: 1190, 25.3k 输出 token/任务 - GDPval-AA v2 · GLM 5.2: 1514, 78.8k 输出 token/任务 Inkling-Small|Inkling|输出 token/任务 τ3-Banking:5%/10%/15%/20%/25%/30%,5k/10k/20k - τ3-Banking · Inkling-Small: 15.5%, 5.1k 输出 token/任务 - τ3-Banking · Inkling: 23.7%, 8.4k 输出 token/任务 - τ3-Banking · Nemotron 3 Ultra: 13.8%, 9.5k 输出 token/任务 - τ3-Banking · DeepSeek V4 Flash: 22.9%, 11.1k 输出 token/任务 - τ3-Banking · DeepSeek V4 Pro: 26.0%, 9.9k 输出 token/任务 - τ3-Banking · Qwen3.5-397B-A17B: 13.4%, 7.7k 输出 token/任务 - τ3-Banking · MiMo V2.5: 6.6%, 6.7k 输出 token/任务 - τ3-Banking · MiMo V2.5 Pro: 9.0%, 7.2k 输出 token/任务 - τ3-Banking · Minimax M2.7: 8.9%, 5.8k 输出 token/任务 - τ3-Banking · MiniMax M3: 13.0%, 5k 输出 token/任务 - τ3-Banking · Kimi K2.5: 14.2%, 5.6k 输出 token/任务 - τ3-Banking · Kimi K2.6: 20.6%, 10.8k 输出 token/任务 - τ3-Banking · GLM 5.2: 26.8%, 19.5k 输出 token/任务 Inkling-Small|Inkling|输出 token/任务 AA-Briefcase (Elo):700/900/1100/1300,30k/60k/100k - AA-Briefcase · Inkling-Small: 917, 29k 输出 token/任务 - AA-Briefcase · Inkling: 839, 52.2k 输出 token/任务 - AA-Briefcase · Nemotron 3 Ultra: 870, 47.5k 输出 token/任务 - AA-Briefcase · DeepSeek V4 Flash: 833, 37.6k 输出 token/任务 - AA-Briefcase · MiMo V2.5 Pro: 878.9, 32.8k 输出 token/任务 - AA-Briefcase · MiniMax M3: 1107.8, 81.9k 输出 token/任务 - AA-Briefcase · GLM 5.2: 1266, 115k 输出 token/任务 Inkling-Small|Inkling|输出 token/任务 CritPt:0%/5%/10%/15%/20%/25%,40k/100k/200k - CritPt · Inkling-Small: 8.3%, 101k 输出 token/任务 - CritPt · Inkling: 5.4%, 79.3k 输出 token/任务 - CritPt · Nemotron 3 Ultra: 3.1%, 82.5k 输出 token/任务 - CritPt · DeepSeek V4 Flash: 7.1%, 202k 输出 token/任务 - CritPt · DeepSeek V4 Pro: 13.0%, 105k 输出 token/任务 - CritPt · Qwen3.5-397B-A17B: 1.7%, 45.2k 输出 token/任务 - CritPt · MiMo V2.5: 3.7%, 41.2k 输出 token/任务 - CritPt · MiMo V2.5 Pro: 4.0%, 58.4k 输出 token/任务 - CritPt · Minimax M2.7: 0.6%, 39.4k 输出 token/任务 - CritPt · MiniMax M3: 3.7%, 77.9k 输出 token/任务 - CritPt · Kimi K2.5: 3.1%, 39.6k 输出 token/任务 - CritPt · Kimi K2.6: 8.0%, 183k 输出 token/任务 - CritPt · GLM 5.2: 20.9%, 106k 输出 token/任务 输出 token/任务 推理与智能体基准上的 token 效率-性能权衡。我们评估了 Inkling-Small 和 Inkling(最大思考强度)以及其他开源权重模型在智能体和推理任务(GDPval-AA v2、τ3-Banking、AA-Briefcase 和 CritPt)上的表现,并展示输出 token 长度(包括推理和答案)。Inkling-Small 是最高效的开源权重模型之一,用虚线标出。结果来自我们自己的评估或 Artificial Analysis 的参考数据。 Inkling-Small 还能在多种编码和智能体框架中流畅运行,是编码和工具使用工作流中经济高效的选择。 ### 多模态 与 Inkling 一样,我们为 Inkling-Small 精心打造了音频智能能力,使其成为真实世界音频应用的优秀候选。我们还改进了它使用 Python 完成视觉任务的能力。该模型可以将视觉推理与裁剪、缩放和程序化图像检查等操作结合起来,提升在文档和图表上的可用性,尤其是当相关信息可能很小或难以直接查看时。 Inkling-Small 与 Inkling 一样采用原生的无编码器多模态架构。音频以 dMel 频谱图表示,图像则被划分为 40×40 像素的 patch,并通过四层 hMLP 进行变换。两者都经过轻量级嵌入层变换,并与文本 token 联合处理。Inkling-Small 在大多数多模态评估中以更低的成本接近 Inkling 的表现。它在视觉推理、图表理解、数学视觉问答、语音理解和较长音频推理方面都保持强劲性能。 音频与视觉基准,对比专精的全模态模型(开源与闭源权重),在 effort=0.99 下报告。 ### 认知与校准(Epistemics) Inkling-Small 在认知与校准方面的训练方式与 Inkling 类似,重点关注校准、指令跟随和抵抗审查。Inkling-Small 在预测任务上与 Inkling 表现相当。校准涉及在大量真实世界预测问题上针对严格评分规则进行强化学习,从而提升其表达适当置信度并在不确定情况下产生校准预测的能力。 ForecastBench 和 Prophet Arena 的结果是在 2026 年 7 月 19 日至 7 月 28 日之间测试获得的。 ### 安全性 Inkling-Small 继承了与 Inkling 相同的安全后训练方案,内置覆盖我们内部安全规范的安全防护。这些防护涵盖日常人机交互以及双重用途能力。Inkling-Small 也经历了相同的部署前测试流程,包括内部评估和由受信任的外部伙伴进行的红队测试。 在衡量模型是否拒绝明显有害请求的 StrongREJECT 上,Inkling-Small 与 Inkling 相当,并与现有开源权重模型的表现持平。在衡量犯罪、暴力和双重用途风险等场景安全性的 FORTRESS 上,它在拒绝率和过度拒绝率两方面都具备竞争力。 安全基准,在 effort=0.99 下报告;全程越高越好。FORTRESS adversarial 指拒绝有害请求的比例,benign 指仍然回答安全请求的比例。 ## Inkling-Small 基准测试 与 Inkling 一样,我们在广泛的能力范围内对 Inkling-Small 进行了基准测试。所有评估均在 effort 0.99 和温度 1.0 下运行。所有编码评估均在 256K 最大 token 轨迹限制下运行,与 Inkling 类似。 为了提高一致性,我们在适用时同时依赖外部报告的评估结果来评估内部和外部模型。具体来说,我们使用以下机构报告的分数: - [Artificial Analysis](https://artificialanalysis.ai/evaluations/):Humanity’s Last Exam、GPQA Diamond、SciCode、GDPval-AA v2、Tau 3 Banking、AA Omniscience、MMMU Pro、AA-Briefcase - [Scale AI](https://scale.com/leaderboard):AudioMC、MCP Atlas - [ARC Prize](https://arcprize.org/):ARC-AGI v1 和 ARC-AGI v2 - [Forecasting Research Institute](https://forecastingresearch.org/):ForecastBench - [ProphetArena](https://www.prophetarena.co/) Inkling-Small 与开源及闭源模型在完整评估套件上的对比。激活参数和总参数用于展示规模;破折号表示在撰写本文时该分数尚未公布。 *SWEBench Verified:Inkling 和 Inkling-Small 的数值使用仅 bash 的 harness 报告。外部模型使用其自报数值。 *Terminal Bench 2.1:Inkling 和 Inkling-Small 的数值使用内部编码 harness 报告。少数解决方案被发现受网络搜索污染,因此被计为 0 分。外部模型在可得时使用自报数值,否则使用我们的内部 harness 报告性能。 †Audio MC:其他模型由于不在官方排行榜上,因此在内部评估。 †VoiceBench:VoiceBench 使用基于规则的硬编码字符串匹配进行评分,这使评估对输出格式差异非常敏感。因此我们添加了一条系统消息,指示模型遵循预期的答案格式。 †HLE with tools:我们使用内部 harness 对 Minimax M2.7、Claude 4.5 Haiku、Gemini 3.5 Flash-Lite 和 GPT 5.6 Luna 进行了基准测试。 ## 在 Tinker 上体验 Inkling-Small Tinker 客户已经亲眼看到,经过正确微调的模型可以在各种任务上胜过闭源模型,而且更快、更便宜。我们相信,Inkling-Small 将广泛性能与高效性集于一身,会让开发者很容易在真实应用中试验和测试它,我们也非常期待看到开发者用它构建出什么样的产品。 Inkling 和 Inkling-Small 现已在 Tinker 上提供限时折扣,并可在 [Tinker Playground](https://tinker.thinkingmachines.ai/playground?utm_source=blog&utm_campaign=inkling_small_model_release) 上使用文本、图像和音频进行对话。Tinker 上的所有其他模型和检查点现在也已在 Tinker Playground 上提供,计费方式见我们的[定价页面](https://tinker-docs.thinkingmachines.ai/tinker/models/)。 Inkling-Small 是为了践行我们的[使命](https://thinkingmachines.ai/blog/the-future-worth-building-is-human/)——构建能够延伸人类意志与判断力的 AI——而打造的。它是一个能力强且高效的模型,也是我们继续前行道路上的重要一步。

相似文章

Inkling:我们的开放权重模型

Hacker News Top

Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。

欢迎使用 Thinking Machines 的 Inkling

Hugging Face Blog

Thinking Machines 的 Inkling 是一个大型开放多模态 LLM,约有1万亿参数、100万上下文窗口,原生支持图像、音频和文本。它采用混合专家架构,可在 Hugging Face 上获取,并提供首日推理支持。