@Marktechpost: Thinking Machines Lab 发布 Inkling:一款具有 975B 参数的开权重多模态 MoE 模型,配备经过训练的思维调节旋钮。无 RoPE…
摘要
Thinking Machines Lab 发布 Inkling,一款拥有 975B 总参数、41B 激活参数的开权重多模态 MoE 模型,并具备可控的思维调节功能。该模型采用无编码器的方式实现多模态,在多个基准测试上达到了最先进水平。
查看缓存全文
缓存时间: 2026/07/16 22:24
Thinking Machines Lab 发布 Inkling:一个 975B 参数、开放权重的多模态 MoE 模型,配备可训练的思考努力调节旋钮。
没有 RoPE。没有视觉编码器。没有音频编码器。
工作原理如下:
-
无编码器的多模态 大多数全模态模型为每种模态配备独立的编码器。Inkling 不这样做。音频以 dMel 频谱图的形式输入——100ms 的块被分类为离散的 mel 箱。图像通过一个四层 hMLP 变成 40x40 像素的块。两者都经过一个轻量级的嵌入塔,然后与文本一起由同一个解码器处理。 → VoiceBench 91.4%, MMMU Pro 73.5%
-
相对注意力,而非 RoPE 位置直接编码在注意力 logits 中。除了 Q/K/V,第四个投影为每个词元、每个注意力头产生一个相对特征,根据键-查询距离进行调整。滑动窗口和全局层以 5:1 的比例交错排列,使用 8 个 KV 头。 → 66 层, 1M token 上下文
-
带共享专家池的 MoE 路由器同时对路由专家和共享专家进行评分。256 个路由专家中的 Top-6,加上 2 个始终激活的共享专家。Sigmoid 路由,无辅助损失的负载均衡。 → 975B 总参数, 41B 激活
-
可控的思考努力 最值得借鉴的部分。在强化学习期间,实验室改变了系统消息并调整了每个样本的词元成本——因此模型学会了调节自己的词元预算。目前已在 transformers 中作为
reasoning_effort参数暴露出来。 → 在 Terminal Bench 2.1 上以约 1/3 的词元消耗匹配 Nemotron 3 Ultra -
数据表现(开放权重,effort=0.99) → FORTRESS Adversarial 78.0% — 在比较中所有开放权重模型中的最高分 → SWEBench Verified 77.6%, MCP Atlas 74.1% → Terminal Bench 2.1 63.8%, 落后 GLM 5.2 共 18.9 分
完整分析: https://marktechpost.com/2026/07/15/thinking-machines-lab-releases-inkling-a-975b-parameter-open-weights-multimodal-moe-with-41b-active-parameters-and-controllable-thinking-effort/…
模型卡: https://thinkingmachines.ai/model-card/inkling/…
HF: https://huggingface.co/thinkingmachines/Inkling…
技术细节: https://thinkingmachines.ai/news/introducing-inkling/…
@thinkymachines
Thinking Machines Lab 发布 Inkling:一个拥有 975B 参数、41B 激活参数和可控思考努力的开放权重多模态 MoE 模型
来源: https://www.marktechpost.com/2026/07/15/thinking-machines-lab-releases-inkling-a-975b-parameter-open-weights-multimodal-moe-with-41b-active-parameters-and-controllable-thinking-effort/ Thinking Machines Lab 刚刚发布了Inkling (https://thinkingmachines.ai/model-card/inkling/),这是他们从头开始训练的第一个模型,权重开放,可在 Tinker 上进行微调。该实验室将其定位为定制化的基础。
什么是 Inkling?
Inkling 是一个混合专家(MoE)Transformer,拥有 975B 总参数和 41B 激活参数。它支持高达 1M token 的上下文窗口。预训练涵盖了 45 万亿个 token 的文本、图像、音频和视频。输入接受文本、图像和音频;输出仅为 UTF-8 文本。
研究团队还预览了 Inkling-Small,一个拥有 276B 参数、12B 激活参数的 MoE 模型。它在许多基准测试上匹配或超越其更大的同类模型,其权重将在测试完成后发布。由于定制化/微调是关键差异化因素,因此架构在这里非常重要。
深入了解架构
该模型架构包括一个 66 层仅解码器 Transformer,带有稀疏 MoE 前馈骨干网络。每个 MoE 层包含 256 个路由专家和 2 个共享专家。每个 token 激活 6 个路由专家,而两个共享专家在每个 token 上都被激活。基于 Sigmoid 的路由器负责选择,使用无辅助损失的负载均衡偏置。路由和共享专家的分数被联合归一化,然后用于加权组合输出。MoE 设计大体上遵循 DeepSeek-V3。
注意力机制偏离了常规。滑动窗口和全局层以 5:1 的比例交错排列,使用 8 个 KV 头。位置使用相对位置嵌入而非 RoPE,实验室报告称其外推效果更好。在键和值投影之后,以及在残差分支输出上,应用了短卷积。
多模态是无编码器的。音频以 dMel 频谱图的形式输入,图像通过一个四层 hMLP 变成 40x40 像素的块。一个轻量级的嵌入层投影两者,然后解码器将它们与文本 token 一起联合处理。
训练在 NVIDIA GB300 NVL72 系统上,对大型矩阵权重使用 Muon 优化器,对其他参数使用 Adam。后训练从基于合成数据(包括由 Kimi K2.5 生成的数据)的 SFT 进行自举。大部分计算投入到异步强化学习(RL)中,扩展到超过 3000 万次 rollout,并且在整个过程中表现出对数线性改善。该 RL 运行也产生了模型的主要控制界面。
在 RL 过程中,研究团队通过更改系统消息和调整每 token 成本来设定努力水平。模型随之学会了在不同的 rollout 中花费不同的 token 预算。发布帖子将努力水平从 0.2 扫描到 0.99,工具链可以直接设置它。在 transformers 中,相同的控制被暴露为一个 reasoning_effort 参数,带有命名级别。
效率数据非常具体明确。在达到与 Nemotron 3 Ultra 相同的 Terminal Bench 2.1 性能时,Inkling 消耗的 token 数仅为后者的三分之一。成本和延迟变得按调用可调,而非按模型固定。
除了努力水平,研究团队还直接瞄准了可信度。
性能
所有的 Inkling 评估都在 effort=0.99 和温度 1.0 条件下进行,编码任务使用 256K 轨迹限制。多项得分由 Artificial Analysis 外部报告。与开放权重的同类模型相比,情况相当有竞争力。
| Benchmark | Inkling | Nemotron 3 Ultra | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro |
|---|---|---|---|---|---|
| HLE (text only) | 29.7% | 26.6% | 35.9% | 40.1% | 35.9% |
| AIME 2026 | 97.1% | 94.2% | 96.4% | 99.2% | 96.7% |
| GPQA Diamond | 87.2% | 86.7% | 91.1% | 89.5% | 88.8% |
| SWEBench Verified | 77.6% | 70.7% | 80.2% | 80.0% | 80.6% |
| Terminal Bench 2.1 | 63.8% | 56.4% | 71.3% | 82.7% | 64% |
| MCP Atlas | 74.1% | 44.7% | 68. |
相似文章
@LiorOnAI: Thinking Machines 新模型:- 完整权重可用 - 原生文本、图像和音频推理 - 总参数975B…
Thinking Machines 发布 Inkling,一种 MoE 模型,总参数975B/活跃41B,支持原生文本、图像和音频推理,上下文窗口达100万 token,完整权重可用。
Inkling:我们的开放权重模型
Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。
@modal:在 Modal 上对 Inkling-Small 的 Day 0 支持。 - 276B 参数 MoE,12B 激活 - 1M 上下文 - 可变思考强度 …
Thinking Machines 发布了 Inkling-Small,这是一个 276B 参数的混合专家模型,具有 12B 激活参数、1M 上下文以及原生图像/音频理解能力,现已在 Modal 上可用,并支持 NVIDIA B300。
Inkling-Small(4分钟阅读)
Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。
thinkingmachines/Inkling
Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.