@Marktechpost: Thinking Machines Lab 发布 Inkling:一款具有 975B 参数的开权重多模态 MoE 模型,配备经过训练的思维调节旋钮。无 RoPE…

X AI KOLs Timeline 模型

摘要

Thinking Machines Lab 发布 Inkling,一款拥有 975B 总参数、41B 激活参数的开权重多模态 MoE 模型,并具备可控的思维调节功能。该模型采用无编码器的方式实现多模态,在多个基准测试上达到了最先进水平。

Thinking Machines Lab 发布 Inkling:一款拥有 975B 参数的开权重多模态 MoE 模型,配备经过训练的思维调节旋钮。 无 RoPE。无视觉编码器。无音频编码器。 以下是其工作原理: 1. 无编码器的多模态 大多数全能模型会为每种模态单独添加一个编码器。Inkling 没有这样做。音频以 dMel 频谱图的形式输入——100 毫秒的片段被分类到离散的梅尔区间。图像通过四层 hMLP 变成 40x40 像素的块。两者都经过一个轻量级的嵌入层,然后与文本一起由同一个解码器处理。 → 91.4% VoiceBench,73.5% MMMU Pro 2. 相对注意力机制,而非 RoPE 位置直接编码在注意力 logits 中。除了 Q/K/V,第四个投影产生每个 token、每个头的相对特征,并根据键-查询距离进行调整。滑动窗口和全局层以 5:1 的比例交错,配备 8 个 KV 头。 → 66 个层,100 万个 token 的上下文 3. 带有共享专家汇聚的 MoE 路由器同时对路由专家和共享专家进行评分。在 256 个路由专家中选择前 6 个,再加上始终激活的 2 个共享专家。Sigmoid 路由,无辅助损失的负载均衡。 → 总参数量 975B,激活参数 41B 4. 可控的思维调节能力 这部分值得借鉴。在强化学习过程中,该实验室改变了系统提示,并调整了不同样本的每个 token 成本——从而使模型学会了调节自己的 token 预算。现在在 transformers 中作为 reasoning_effort 参数暴露。 → 在 Terminal Bench 2.1 上以约三分之一的 token 数匹配 Nemotron 3 Ultra 5. 数据(开源权重,effort=0.99) → FORTRESS Adversarial 78.0%——在所有被比较的开源权重模型中最高 → SWEBench Verified 77.6%,MCP Atlas 74.1% → Terminal Bench 2.1 63.8%,落后 GLM 5.2 18.9 个百分点 完整分析:https://marktechpost.com/2026/07/15/thinking-machines-lab-releases-inkling-a-975b-parameter-open-weights-multimodal-moe-with-41b-active-parameters-and-controllable-thinking-effort/… 模型卡:https://thinkingmachines.ai/model-card/inkling/… Hugging Face:https://huggingface.co/thinkingmachines/Inkling… 技术细节:https://thinkingmachines.ai/news/introducing-inkling/… @thinkymachines
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:24

Thinking Machines Lab 发布 Inkling:一个 975B 参数、开放权重的多模态 MoE 模型,配备可训练的思考努力调节旋钮。

没有 RoPE。没有视觉编码器。没有音频编码器。

工作原理如下:

  1. 无编码器的多模态 大多数全模态模型为每种模态配备独立的编码器。Inkling 不这样做。音频以 dMel 频谱图的形式输入——100ms 的块被分类为离散的 mel 箱。图像通过一个四层 hMLP 变成 40x40 像素的块。两者都经过一个轻量级的嵌入塔,然后与文本一起由同一个解码器处理。 → VoiceBench 91.4%, MMMU Pro 73.5%

  2. 相对注意力,而非 RoPE 位置直接编码在注意力 logits 中。除了 Q/K/V,第四个投影为每个词元、每个注意力头产生一个相对特征,根据键-查询距离进行调整。滑动窗口和全局层以 5:1 的比例交错排列,使用 8 个 KV 头。 → 66 层, 1M token 上下文

  3. 带共享专家池的 MoE 路由器同时对路由专家和共享专家进行评分。256 个路由专家中的 Top-6,加上 2 个始终激活的共享专家。Sigmoid 路由,无辅助损失的负载均衡。 → 975B 总参数, 41B 激活

  4. 可控的思考努力 最值得借鉴的部分。在强化学习期间,实验室改变了系统消息并调整了每个样本的词元成本——因此模型学会了调节自己的词元预算。目前已在 transformers 中作为 reasoning_effort 参数暴露出来。 → 在 Terminal Bench 2.1 上以约 1/3 的词元消耗匹配 Nemotron 3 Ultra

  5. 数据表现(开放权重,effort=0.99) → FORTRESS Adversarial 78.0% — 在比较中所有开放权重模型中的最高分 → SWEBench Verified 77.6%, MCP Atlas 74.1% → Terminal Bench 2.1 63.8%, 落后 GLM 5.2 共 18.9 分

完整分析: https://marktechpost.com/2026/07/15/thinking-machines-lab-releases-inkling-a-975b-parameter-open-weights-multimodal-moe-with-41b-active-parameters-and-controllable-thinking-effort/…

模型卡: https://thinkingmachines.ai/model-card/inkling/…

HF: https://huggingface.co/thinkingmachines/Inkling…

技术细节: https://thinkingmachines.ai/news/introducing-inkling/…

@thinkymachines


Thinking Machines Lab 发布 Inkling:一个拥有 975B 参数、41B 激活参数和可控思考努力的开放权重多模态 MoE 模型

来源: https://www.marktechpost.com/2026/07/15/thinking-machines-lab-releases-inkling-a-975b-parameter-open-weights-multimodal-moe-with-41b-active-parameters-and-controllable-thinking-effort/ Thinking Machines Lab 刚刚发布了Inkling (https://thinkingmachines.ai/model-card/inkling/),这是他们从头开始训练的第一个模型,权重开放,可在 Tinker 上进行微调。该实验室将其定位为定制化的基础。

什么是 Inkling?

Inkling 是一个混合专家(MoE)Transformer,拥有 975B 总参数和 41B 激活参数。它支持高达 1M token 的上下文窗口。预训练涵盖了 45 万亿个 token 的文本、图像、音频和视频。输入接受文本、图像和音频;输出仅为 UTF-8 文本。

研究团队还预览了 Inkling-Small,一个拥有 276B 参数、12B 激活参数的 MoE 模型。它在许多基准测试上匹配或超越其更大的同类模型,其权重将在测试完成后发布。由于定制化/微调是关键差异化因素,因此架构在这里非常重要。

深入了解架构

该模型架构包括一个 66 层仅解码器 Transformer,带有稀疏 MoE 前馈骨干网络。每个 MoE 层包含 256 个路由专家和 2 个共享专家。每个 token 激活 6 个路由专家,而两个共享专家在每个 token 上都被激活。基于 Sigmoid 的路由器负责选择,使用无辅助损失的负载均衡偏置。路由和共享专家的分数被联合归一化,然后用于加权组合输出。MoE 设计大体上遵循 DeepSeek-V3。

注意力机制偏离了常规。滑动窗口和全局层以 5:1 的比例交错排列,使用 8 个 KV 头。位置使用相对位置嵌入而非 RoPE,实验室报告称其外推效果更好。在键和值投影之后,以及在残差分支输出上,应用了短卷积。

多模态是无编码器的。音频以 dMel 频谱图的形式输入,图像通过一个四层 hMLP 变成 40x40 像素的块。一个轻量级的嵌入层投影两者,然后解码器将它们与文本 token 一起联合处理。

训练在 NVIDIA GB300 NVL72 系统上,对大型矩阵权重使用 Muon 优化器,对其他参数使用 Adam。后训练从基于合成数据(包括由 Kimi K2.5 生成的数据)的 SFT 进行自举。大部分计算投入到异步强化学习(RL)中,扩展到超过 3000 万次 rollout,并且在整个过程中表现出对数线性改善。该 RL 运行也产生了模型的主要控制界面。

在 RL 过程中,研究团队通过更改系统消息和调整每 token 成本来设定努力水平。模型随之学会了在不同的 rollout 中花费不同的 token 预算。发布帖子将努力水平从 0.2 扫描到 0.99,工具链可以直接设置它。在 transformers 中,相同的控制被暴露为一个 reasoning_effort 参数,带有命名级别。

效率数据非常具体明确。在达到与 Nemotron 3 Ultra 相同的 Terminal Bench 2.1 性能时,Inkling 消耗的 token 数仅为后者的三分之一。成本和延迟变得按调用可调,而非按模型固定。

除了努力水平,研究团队还直接瞄准了可信度。

性能

所有的 Inkling 评估都在 effort=0.99 和温度 1.0 条件下进行,编码任务使用 256K 轨迹限制。多项得分由 Artificial Analysis 外部报告。与开放权重的同类模型相比,情况相当有竞争力。

BenchmarkInklingNemotron 3 UltraKimi K2.6GLM 5.2DeepSeek V4 Pro
HLE (text only)29.7%26.6%35.9%40.1%35.9%
AIME 202697.1%94.2%96.4%99.2%96.7%
GPQA Diamond87.2%86.7%91.1%89.5%88.8%
SWEBench Verified77.6%70.7%80.2%80.0%80.6%
Terminal Bench 2.163.8%56.4%71.3%82.7%64%
MCP Atlas74.1%44.7%68.

相似文章

Inkling:我们的开放权重模型

Hacker News Top

Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。

Inkling-Small(4分钟阅读)

TLDR AI

Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。

thinkingmachines/Inkling

Hugging Face Models Trending

Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.