@yifanzhang_: https://thinkingmachines.ai/news/introducing-inkling/… RoPE已死,GRAPE万岁!

X AI KOLs Timeline 模型

摘要

Thinking Machines AI发布了Inkling,这是一个开放权重的混合专家模型,总参数975B(41B活跃),支持文本、图像和音频,上下文窗口为100万token。它是一个广泛的基础模型,旨在通过其Tinker平台进行微调,同时还预览了较小的Inkling-Small变体。

https://thinkingmachines.ai/news/introducing-inkling/… RoPE已死,GRAPE万岁!
查看原文
查看缓存全文

缓存时间: 2026/07/16 20:22

https://thinkingmachines.ai/news/introducing-inkling/… RoPE已死,GRAPE万岁!


Inkling:我们的开放权重模型

来源:https://thinkingmachines.ai/news/introducing-inkling/ 我们的使命(https://thinkingmachines.ai/blog/the-future-worth-building-is-human/)是构建能够延伸人类意志和判断的AI。我们已经开发了一个平台(https://thinkingmachines.ai/tinker/),让任何人都能定制模型;预览了一个为交互式协作构建的AI系统(https://thinkingmachines.ai/blog/interaction-models/);并发表了新颖的研究(https://thinkingmachines.ai/blog/)。今天,我们向前迈出一步,发布了一个我们从零开始训练、提供全部权重的模型,以便人们可以将其据为己有。

我们的模型名为Inkling,是一个总参数975B、活跃参数41B的混合专家Transformer。它支持高达1M令牌的上下文窗口,并在45万亿文本、图像、音频和视频标记上进行了预训练。它是不同尺寸模型系列中的第一个:与之同时,我们还分享了Inkling-Small的预览版,这是一个活跃参数12B的轻量级模型,采用类似配方训练,在更低成本和延迟下实现了强劲性能。

Inkling原生处理文本、图像和音频的推理,并通过高效且可控的思考努力来平衡成本与性能。我们将其训练为一个广泛、均衡的基础模型:在多个领域表现强劲,且足够灵活以适应需求。Inkling并非当前可用(无论开源或闭源)中最强的整体模型。相反,多种品质的结合使其成为优秀的开放权重定制基座:多模态能力、高效思考,以及在Tinker上可用于微调。Inkling只是一个开始:这是我们模型系列的首次发布,我们将在此基础上继续构建。

我们希望让更多用例能够便捷地进行定制,因此Inkling现已可在Tinker上进行微调。选择正确的基座模型进行微调是一个定性判断,它结合了可衡量的基准测试与通过实际体验模型所获得的独特感受。为了支持后者,我们在Tinker控制台中添加了Inkling Playground:一个面向开发者的Inkling聊天界面。

为了展示定制在实践中的意义,我们让Inkling微调了它自己。使用Tinker,模型编写了自己的微调任务,运行了它,并评估了结果:

开放代码

构建·inkling· tinker-prod

~/news/introducing-inkling/1.33.7 在OpenCode中启动:Inkling在OpenCode框架内运行。## 能力

现实应用需要具备广泛能力的模型,这些能力可以通过微调进行组合和提升。我们展示了Inkling的能力及其在可靠性和安全性等重要品质上的表现。

通用模型

Inkling被设计为广泛的模型。我们在代理、推理、编码、指令遵循、事实性、视觉和音频任务上进行了训练,而不是为某个领域进行狭隘优化。这种广度对于定制和现实使用至关重要:不同用户需要能够适应非常不同工作流程的模型,而不仅仅是在基准测试上表现出色。

雷达图比较了Inkling、Nemotron 3 Ultra、GLM 5.2、GPT 5.6 Sol和Claude Fable 5在十项评估上的得分(0到100分)。Inkling用较重的钴色线表示。没有报告得分的评估项在零处绘制。悬停即可比较每个模型的得分。

Inkling是一个广泛、均衡的通用模型。基准测试分数显示在共同的0-100分尺度上;越高越好。结果显示在文本、代理、多模态和音频评估中具有竞争力的表现,而非针对某一基准测试系列进行狭隘优化的模型。这种广度反映了Inkling的预期角色:一个实用的多模态基础模型,可用于跨领域、工作流程和产品的定制。### 代理编码和工具使用

适合微调的强大基座需要能够灵活地通过代理工具使用解决各种任务。在大多数代理基准测试中,Inkling在开放权重模型中得分良好。

我们训练Inkling在各种编码和代理框架内运行,并在训练期间随机化工具集和模式,以减少对任何特定工具的敏感性。Inkling的可控思考努力(下节描述)可以在框架内设置。

以下是一些演示,展示了Inkling的代理编码和工具使用及其生成的工件。

单次网页应用与嵌入式浏览器使用

Inkling在单次生成中构建了一个功能完整的网页应用,然后驱动一个嵌入式AI助手,通过自然语言指令操作该网页应用界面。

Inkling从第二个标签页的提示中一次性生成了一个求职申请网页应用,然后一个浏览器使用代理从保存的配置文件中填写表单。##### 设计竞技场

Inkling在设计竞技场的Agentic Web Dev排行榜上接受了评估,盲审人类评估员对生成的网页应用进行直接比较。它在最强的开放权重模型中名列前茅。

Claude Sonnet 5

1333

Claude Fable 5

1329

Claude Opus 4.8

1285

GLM 5.2

1275

Grok 4.5

1271

GPT-5.6 Sol

1260

Inkling

1257

Claude Opus 4.6

1257

Gemini 3.5 Flash

1254

Kimi K2.6

1249

Claude Sonnet 4.6

1237

Kimi K2.7 Code

1234

GLM 5.1

1233

Claude Opus 4.5

1212

Grok 4.20 Reasoning

1203

Gemini 3.1 Pro Preview

1187

Grok 4.3

1185

Kimi K2.5 (Thinking)

1185

Inkling在设计竞技场的Agentic Web Dev排行榜上的位置,这是一个盲审人类评估生成的应用程序。点代表开放权重模型。#### 风格一致的工件

Inkling创建多页工件,具有精确的指令遵循、准确的信息以及整体协调的风格和设计。

从第二个标签页的提示,Inkling生成了一个精致的九页PDF美食旅行日志——在上述浏览实际文档。#### 通过长优化循环创建的多玩家游戏

Inkling通过40轮来自GPT Codex(作为评审)的反馈,优化了一个在线贪吃蛇游戏。维持长优化过程并从反馈中改进的能力对于创造最佳协作作品至关重要。

一个由Inkling从第二个标签页的提示生成的多玩家贪吃蛇游戏——包含实时服务器、机器人、排行榜等。### 可控思考努力

测试时扩展和问题解决是每个模型的核心能力,但这种能力很难用一个数字来概括。为专门任务微调模型的开发者,既关心效率(https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/),也关心公共基准测试上的最大努力性能。成本和延迟通常是现实应用中的约束条件,而低延迟对于通过迭代实现协作和改进至关重要。

Inkling (努力扫描)GLM-5.2Kimi K2.6Nemotron 3 UltraKimi K2.5GPT-OSS (高)

将Inkling的努力设置从0.2扫描到0.99,在Terminal Bench 2.1、HLE和IFBench上绘制其性能与平均生成令牌的关系;竞争模型显示在其默认操作点。Inkling在更少的令牌下达到给定分数——例如,在Terminal Bench 2.1上,它在大约三分之一的令牌下就匹配了Nemotron 3 Ultra。*Humanity’s Last Exam分数反映的是更早期的检查点,略低于最终发布版本。Inkling支持可控思考努力,允许您在性能与令牌效率之间取得平衡。上面的图表显示了Inkling以及其他开放权重模型在一系列基准测试上的努力/性能曲线:Terminal Bench 2.1(代理编码)、HLE(高级推理)和IFBench(指令遵循)。Inkling花费三分之一的令牌即可在Terminal Bench上达到与Nemotron 3 Ultra相同的性能。成本和延迟对于您要运行数百万次并作为更长工作流一部分的模型来说很重要;查看完整的成本曲线让开发人员能为每种用例选择最佳模型。

多模态

Inkling设计的一个主要目标是作为我们最近引入的交互模型系统(https://thinkingmachines.ai/blog/interaction-models/)中的后台推理模型。交互模型使用户能够通过语音和视觉进行实时自然协作。这需要一个经过广泛多模态能力原生训练的模型。

针对专业全模态模型(开放和封闭权重)的音频和视觉基准测试,在努力=0.99时报告。

多模态组件是在通用领域数据上从零开始训练的。我们为音频和视觉输入选择了无编码器架构,这与交互模型设计一致。音频信号作为dMel频谱图dMel: Speech Tokenization made Simple (https://arxiv.org/abs/2407.15835) (Richard He Bai et al, 2024)输入,而图像则使用四层hMLPThree things everyone should know about Vision Transformers (https://arxiv.org/abs/2203.09795) (Hugo Touvron et al, 2022)编码为40x40像素的块。两者都通过轻量级嵌入层进行转换,并与文本标记一起联合处理。

Inkling能够转录语音、遵循语音指令、回答关于录音的问题,并对较长形式的音频进行推理。这些能力使其在VoiceBench、MMAU和AudioMC上处于最强的开放权重音频模型之列。在视觉方面,Inkling接受图像输入,并能描述视觉内容、回答问题,以及基于提供的视觉信息进行深度推理。它在图表、图示和数学视觉推理任务上表现出强大性能。在推理过程中,Inkling还可以利用Python工具通过缩放和裁剪等操作来支持图像理解,同时无缝地将视觉推理与基于代码的推理结合起来。

作为我们的首次发布,Inkling为未来的工作奠定了强大的多模态基础。我们期望其多模态能力在后续迭代中随着模型和训练管道的扩展而持续提升。

认识论

我们在校准、指令遵循和抵制审查方面对Inkling进行了训练,我们统称这些为模型的认识论

正确获取事实需要不仅仅是记住大量的知识语料库。一个有用的模型必须校准良好,在其答案中表达适当的置信度——包括那些尚未有定论的问题。后者对于预测和预报至关重要,这是一个重要的用例,微调模型在最近几个月展示了快速提升(https://thinkingmachines.ai/news/training-llms-to-predict-world-events/),甚至超越了前沿LLM(https://x.com/tinkerapi/status/2056798250532057139)。

结果是在2026年6月30日至7月13日期间,使用Inkling的不同检查点(而非发布的版本)进行的测试。

预报需要将多个信息源整合成校准后的概率,这是用户信任模型的核心技能。一个对每个答案都充满信心的模型,包括当它缺失信息并胡编乱造时,迫使用户必须反复核对一切。一个给出适当置信度的模型在更多现实世界中是有用的,这些领域的信息经常相互冲突、不可靠或难以找到。我们通过使用适当的评分规则,对大量已解决的真实世界问题进行强化学习,从而针对校准进行训练。

可信赖模型的第二个组成部分是指令遵循,包括难以验证的复杂查询。我们使用了两种自动评分器进行强化学习:一个标准评分器和一个声明评分器。第一个评分器根据一个好的答案应包含的检查清单对每个响应进行评分。标准原则上可以惩罚错误,但实际上它们强调召回率,并且可能被模型通过喷洒看似相关的事实以匹配标准项所利用。声明评分器验证响应中的每个事实声明,惩罚那些不成立的声明。它执行代理网络搜索以验证声明,而不仅仅依赖自身知识。两个评分器一起提高了有用性,同时减少了幻觉,而不是在两者之间进行取舍。

这些奖励并不直接针对长形式响应中的校准不确定性,因此我们添加了针对性的数据集来解决这个问题。最大的是短形式事实问答,带有弃权感知奖励:只有在模型可能正确时才回答,因此最优策略是在有信心时回答,否则说“我不知道”或给出一个带有风险规避的最佳猜测。一些提示鼓励或禁止风险规避,教导模型遵循用户对强制猜测与校准非答案的偏好。

最后,我们训练Inkling直接回答可能受审查的话题。Cognition使用其Propaganda and Censorship EvalThe Cognition Team, “Measuring the Trustworthiness of Open-Source-Derived Models (https://cognition.com/blog/measuring-open-source-model-trustworthiness),” 2026. 对模型进行了评估,结果显示其具有强大的审查不遵从模式。

安全性

我们按照内部安全行为规范,在所有模态上训练了Inkling。然后我们委托外部安全测试人员验证结果。

我们在几个领域评估了Inkling的安全性。对于危险能力——CBRN、网络攻击和失控——我们进行了内部评估并聘请了外部测试人员。我们关注人机威胁向量,包括谄媚、脆弱用户和有害操纵,使用了内部评估和外部测试人员。

在FORTRESS基准测试上,Inkling在我们比较的任何开放权重模型中展示了最强的内置安全防护措施,该基准测试测试了对武器和暴力相关请求的拒绝,同时包含了良性的类似查询。Inkling拒绝了更多有害请求,同时没有过度拒绝良性的类似请求。在StrongREJECT(一个明确有害请求的拒绝测试)上,Inkling得分超过98%,与其他开放和封闭权重模型一致。

安全性对于开放权重模型至关重要。我们正在继续研究可定制模型中的安全行为和能力提升,包括微调如何在Tinker上影响安全行为。

基准测试 Inkling

我们在广泛的能力范围内对Inkling进行基准测试。所有评估在努力0.99和温度1.0下运行。所有编码评估以256K最大标记轨迹限制运行。

为提高一致性,我们在适用时依赖外部报告的评估结果,包括内部和外部模型。具体来说,我们使用Artificial Analysis报告的以下评估分数:Humanity’s Last Exam, GPQA Diamond, GDPVal, Tau 3 Banking, AA Omniscience, MMMU Pro。

*SWEBench Verified:Inkling分数使用仅bash的框架报告。外部模型使用自我报告分数。*Terminal Bench 2.1:Inkling分数使用内部编码框架报告。发现少数解决方案因网络搜索受到污染,被赋予0分。外部模型在可用时使用自我报告分数。否则,我们使用内部框架报告性能。†Audio MC:其他模型在内部评估,因为它们不在官方排行榜上。†VoiceBench:VoiceBench使用基于规则的硬编码字符串匹配进行评分,使评估对输出格式差异敏感。因此我们添加了一条系统消息,指示模型遵循预期的答案格式。†CharXiv RQ with tools:我们使用Claude Fable 5和GPT 5.6 Sol (max/xhigh)进行了基准测试。

相似文章

Inkling:我们的开放权重模型

Hacker News Top

Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。

thinkingmachines/Inkling-NVFP4

Hugging Face Models Trending

Inkling is a 975B-parameter sparse mixture-of-experts multimodal model accepting text, image and audio inputs and generating text outputs. Released with open weights for research, fine-tuning, and integration.

欢迎使用 Thinking Machines 的 Inkling

Hugging Face Blog

Thinking Machines 的 Inkling 是一个大型开放多模态 LLM,约有1万亿参数、100万上下文窗口,原生支持图像、音频和文本。它采用混合专家架构,可在 Hugging Face 上获取,并提供首日推理支持。

thinkingmachines/Inkling

Hugging Face Models Trending

Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.