Inkling:我们的开放权重模型

Hacker News Top 模型

摘要

Thinking Machines AI 发布了 Inkling,这是一个新的开放权重混合专家多模态基础模型,总参数 975B,激活参数 41B,支持文本、图像、音频和视频,同时提供了 Inkling-Small 的预览。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/15 19:44

# Inkling:我们的开放权重模型 来源:https://thinkingmachines.ai/news/introducing-inkling/ 我们的使命(https://thinkingmachines.ai/blog/the-future-worth-building-is-human/)是构建能够延伸人类意志与判断的AI。我们开发了一个平台(https://thinkingmachines.ai/tinker/),让任何人都能定制模型;预告了一个为交互式协作而构建的AI系统(https://thinkingmachines.ai/blog/interaction-models/);并发表了新颖的研究成果(https://thinkingmachines.ai/blog/)。今天,我们通过发布一个从头训练、提供完整权重的模型来推进这一使命,让每个人都能将其变为自己的模型。 我们的模型名为Inkling,是一个拥有9750亿总参数、410亿激活参数的混合专家Transformer。它支持高达100万token的上下文窗口。它在45万亿token的文本、图像、音频和视频数据上进行了预训练。这是不同尺寸模型系列中的第一个:与此同时,我们还分享了Inkling-Small的预览版,这是一个更轻量的模型,拥有120亿激活参数,采用类似的训练方法,以更低的成本和延迟实现了强大的性能。 Inkling原生支持对文本、图像和音频进行推理,并通过高效且可控的思考力度来平衡成本与性能。我们将其训练为一个广泛、均衡的基础模型:在多个领域表现强劲,灵活且易于适配。Inkling并非现今(无论是开放还是封闭)最强的整体模型。相反,多种特质的结合使其成为一个良好的可定制化开放权重基础:多模态能力、高效思考,以及可在Tinker上进行微调。Inkling仅仅是个开始:这是我们模型系列的第一个版本,我们将继续在此基础上构建。 我们希望让更多用例能够轻松进行定制,因此Inkling今天即可在Tinker上进行微调。选择合适的基础模型进行微调是一个定性判断,它既需要可衡量的基准测试,也需要通过与模型互动获得的独特感觉。为了实现后者,我们在Tinker控制台中添加了Inkling Playground:一个供开发者与Inkling对话的界面。 为了展示定制的实际意义,我们让Inkling微调了它自己。通过Tinker,该模型编写了自己的微调任务,运行它,并评估了结果: OpenCode **构建**·inkling· tinker-prod ~/news/introducing-inkling/1.33.7 在OpenCode中启动:Inkling在OpenCode框架内运行。 ## 能力 实际应用需要模型具备广泛的能力,这些能力可以通过微调进行组合和提升。我们将展示Inkling的能力以及在可信度和安全性等重要方面的表现。 ### 通才模型 Inkling被设计为广泛的模型。我们在智能体、推理、编码、指令遵循、事实性、视觉和音频任务上进行训练,而不是狭隘地优化单一领域。这种广度对于定制和实际使用很重要:不同的用户需要能够适应截然不同工作流程的模型,而不仅仅是在基准测试中表现出色。 雷达图比较了Inkling、Nemotron 3 Ultra、GLM 5.2、GPT 5.6 Sol和Claude Fable 5在十个评估项目上的得分(0到100分)。Inkling以较重的钴蓝色线条显示。未报告模型得分的评估项目在零处绘制。悬停在某个评估项目上可比较每个模型的得分。 Inkling是一个广泛、均衡的通才模型。基准测试分数以共同的0-100分制显示;越高越好。结果显示,在文本、智能体、多模态和音频评估中具有竞争力的表现,而非针对某一基准测试系列进行狭隘优化。这种广度反映了Inkling的预期角色:一个实用的多模态基础模型,可用于跨领域、工作流程和产品的定制。 ### 智能体编码与工具使用 一个强大的微调基础需要能够通过智能体工具使用灵活解决各种任务。Inkling在大多数智能体基准测试中在开放权重模型中得分较高。 我们训练Inkling在各种编码和智能体框架中运行,并在训练期间随机化工具集和模式,以减少对特定工具的敏感性。Inkling的可控思考力度(下一节描述)可以在框架内设置。 以下是一些演示,展示了Inkling的智能体编码和工具使用能力及其创建的工件。 #### 单次生成Web应用并嵌入浏览器使用 Inkling单次生成一个功能性的Web应用,然后驱动一个嵌入式AI助手,该助手可以通过自然语言指令操作Web应用界面。 Inkling从第二个标签页中的提示单次生成一个求职申请Web应用,然后一个浏览器使用代理根据保存的个人资料填写表单。 ##### 设计竞技场 Inkling在设计竞技场的智能体Web开发排行榜上进行了评估,盲测人类评估者将生成的Web应用进行头对头比较。它在最强的开放权重模型中名列前茅。 Claude Sonnet 5 1333 Claude Fable 5 1329 Claude Opus 4.8 1285 GLM 5.2 1275 Grok 4.5 1271 GPT-5.6 Sol 1260 Inkling 1257 Claude Opus 4.6 1257 Gemini 3.5 Flash 1254 Kimi K2.6 1249 Claude Sonnet 4.6 1237 Kimi K2.7 Code 1234 GLM 5.1 1233 Claude Opus 4.5 1212 Grok 4.20 Reasoning 1203 Gemini 3.1 Pro Preview 1187 Grok 4.3 1185 Kimi K2.5 (Thinking) 1185 Inkling在设计竞技场智能体Web开发排行榜上的位置,这是一个对生成应用进行盲测的人类评估。 #### 风格统一的工件 Inkling创建多页面工件,具有精确的指令遵循、准确的信息以及贯穿始终的统一风格和设计。 从第二个标签页中的提示,Inkling生成一个精美的九页PDF美食与旅行日志——请在上方浏览实际文档。 #### 通过长反馈循环创建的多人在线游戏 Inkling通过40轮来自GPT Codex(作为评审者)的反馈,完善了一个在线贪吃蛇游戏。维持一个长的改进过程并从反馈中学习的能力对于创造最佳协作成果至关重要。 一个由Inkling根据第二个标签页中的提示生成的多人在线贪吃蛇游戏——包含实时服务器、机器人和排行榜。 ### 可控思考力度 测试时扩展和问题解决是每个模型的核心能力,但这种能力很难用一个数字来捕捉。为专业任务微调模型的开发者既关心效率(https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/),也关心公共基准测试上的最大努力表现。成本和延迟通常是实际应用中的约束条件,尤其是低延迟对于通过迭代实现协作和改进至关重要。 Inkling (努力度扫描) GLM-5.2 Kimi K2.6 Nemotron 3 Ultra Kimi K2.5 GPT-OSS (高) 从0.2到0.99扫描Inkling的努力度设置,绘制其在Terminal Bench 2.1、HLE和IFBench上的性能与平均生成token的关系;竞争模型显示在其默认工作点。Inkling以更少的token达到给定的分数——例如,在Terminal Bench 2.1上,它用大约三分之一的token就匹配了Nemotron 3 Ultra。*人类终极考试(Humanity's Last Exam)分数反映的是较早的检查点,略低于最终发布版。 Inkling支持可控的思考力度,允许您在性能与token效率之间取得平衡。上图显示了Inkling以及其他开放权重模型在一系列基准测试上的努力度/性能曲线:Terminal Bench 2.1(智能体编码)、HLE(高级推理)和IFBench(指令遵循)。Inkling在Terminal Bench上用三分之一的token就达到了与Nemotron 3 Ultra相同的性能。成本和延迟对于一个要运行数百万次并作为更长工作流一部分的模型来说至关重要;查看完整的成本曲线允许开发者为每个用例选择最佳模型。 ### 多模态 Inkling设计的一个主要目标是作为我们最近引入的交互模型系统(https://thinkingmachines.ai/blog/interaction-models/)中的背景推理模型。交互模型使用户能够以语音和视觉实时自然协作。这需要一个原生训练用于广泛多模态能力的模型。 音频和视觉基准测试(针对专业全能模型,包括开放和封闭权重),在努力度=0.99时报告。 多模态组件在通用领域数据上从头训练。对于音频和视觉输入,我们采用无编码器架构,这符合交互模型的设计。音频信号作为离散的dMel频谱图输入(Bai et al., 2024 (https://arxiv.org/abs/2407.15835))。图像则使用四层hMLP(Touvron et al., 2022 (https://arxiv.org/abs/2203.09795))编码为40×40像素的块。两者都通过轻量级嵌入层进行转换,并与文本token一起处理。 Inkling可以转录语音、遵循语音指令、回答关于录音的问题,并对较长形式的音频进行推理。这些能力使其在VoiceBench、MMAU和AudioMC上成为最强的开放权重音频模型之一。在视觉方面,Inkling接受图像输入,可以描述视觉内容、回答问题,并根据提供的视觉信息进行深入推理。它在图表、示意图和数学视觉推理任务上表现出色。在推理过程中,Inkling还可以利用Python工具通过缩放和裁剪等操作来支持图像理解,同时将视觉推理与基于代码的推理无缝集成。 作为我们的首次发布,Inkling为未来的工作奠定了强大的多模态基础。我们预计随着后续迭代中模型和训练流程的扩展,其多模态能力将持续提升。 ### 认知质量 我们训练Inkling以追求校准性、指令遵循和抵制审查,我们将这些统称为模型的“认知质量”。 获得正确事实需要的不仅仅是记住大量知识库。一个有用的模型必须具有良好的校准性,在其答案中表达适当的信心——包括那些尚未有定论的问题。后者对于预测和预报至关重要,这是最近几个月微调模型展示出快速提升(https://thinkingmachines.ai/news/training-llms-to-predict-world-events/)的一个重要用例,其表现优于前沿LLM(https://x.com/tinkerapi/status/2056798250532057139)。 ↑ 越高越好;↓ 越低越好。ForecastBench值显示平均值±标准误差,测试运行时间为6月30日至7月13日;Inkling反映的是较早的检查点。 预测需要将多个信息来源整合成一个经过校准的概率,这是用户可信任模型的核心技能。一个对每个答案都充满信心(包括当它缺少信息并胡编乱造时)的模型会迫使用户重复检查所有内容。一个给出适当信心的模型在更多现实领域很有用,这些领域的信息常常是矛盾、不可靠或难以找到的。我们使用基于正确评分规则(proper scoring rules)的强化学习,在一个大型已解决现实问题语料库上训练了校准能力。 可信模型的第二个组成部分是指令遵循,包括对难以验证的复杂查询的遵循。我们使用了两个自动评分器进行强化学习:一个评分标准评分器和一个事实性评分器。第一个评分器根据一个好答案应该包含的内容清单对每个回答进行评分。评分标准原则上可以惩罚错误,但实际上它们强调召回率,并且可能被模型通过喷出看似相关的事实以试图匹配评分标准项目而利用。主张评分器验证回答中的每个事实性主张,惩罚那些无法核实的主张。它执行智能体网络搜索以验证主张,而不仅仅依赖自身知识。两者结合同时提高了有用性并减少了幻觉,而非在两者间进行取舍。 这些奖励并不直接针对长形式回答中的校准不确定性,因此我们添加了针对性的数据集。最大的是短形式事实性问答,带有基于弃权的奖励:只有在模型可能正确时回答才有回报,因此最优策略是在有信心时回答,否则说“我不知道”或给出有保留的最佳猜测。一些提示鼓励或禁止保留,教会模型遵循用户对强制猜测与校准性非回答的偏好。 最后,我们训练Inkling直接回答可能受到审查的主题。Cognition在它们的宣传与审查评估(The Cognition Team, "Measuring the Trustworthiness of Open-Source-Derived Models (https://cognition.com/blog/measuring-open-source-model-trustworthiness)," 2026)上评估了该模型,结果显示其具有很强的非审查合规模式。 ### 安全性 我们按照内部规范在所有模态上训练了Inkling的安全行为。然后,我们委托外部安全测试人员验证结果。 我们在几个方面评估了Inkling的安全性。对于危险能力——CBRN、网络和失控——我们进行了内部评估并聘请了外部测试人员。我们关注了人机交互威胁向量,包括谄媚、弱势用户和有害操纵,使用了内部评估和外部测试人员。 在FORTRESS基准测试上(该测试测试对与武器和暴力相关的请求的拒绝,同时包含良性相似查询),Inkling展示了我们比较过的所有开放权重模型中最强的内置安全防护。Inkling拒绝了更多有害请求,同时不过度拒绝良性类似请求。Inkling在StrongREJECT(对明确有害请求的拒绝测试)上得分超过98%,与其他开放和封闭权重模型一致。 安全性对于开放权重模型至关重要。我们正在继续研究可定制模型中的安全行为和能力提升,包括在Tinker上进行微调如何影响安全行为。 ## Inkling的基准测试 我们在广泛的能力范围上对Inkling进行基准测试。所有评估均在努力度0.99和温度1.0下运行。所有编码评估以256K最大token轨迹限制运行。 为提高一致性,我们在适用时依赖外部报告的评估结果。具体来说,我们使用Artificial Analysis报告的以下评估分数:人类终极考试(Humanity's Last Exam)、GPQA Diamond、GDPVal、Tau 3 Banking、AA Omniscience、MMMU Pro。 *我们将Terminal Bench 2.1中通过网络搜索产生解决方案污染的运行分配为0分。 †我们使用内部Python框架评估了Claude Fable 5和GPT 5.6 Sol (max/xhigh)在CharXiv RQ(使用python)上的表现。 ## Inkling的构建过程 ### 架构 Inkling是一个混合专家Transformer,与常见配方有若干不同之处,每个不同之处都是为了效率和长上下文性能而选择的。 MoE设计主要遵循DeepSeek-V3。每个MoE层包含256个路由专家和2个共享专家,每个token激活6个路由专家。Inkling使用基于sigmoid的路由器,带有无辅助损失的负载均衡偏差;所选路由专家和共享专家的分数被联合归一化,并用于加权它们的组合输出。 在注意力方面,我们以5:1的比例交错滑动窗口和全局层,使用8个KV头。我们发现使用相对位置嵌入(一种学习到的、依赖于输入的偏置,添加到注意力分数中,遵循Shaw et al., 2018 (https://arxiv.org/abs/1807.02563))是有效的。

相似文章

Inkling-Small(4分钟阅读)

TLDR AI

Thinking Machines发布了Inkling-Small,这是一个高效的开放权重混合专家模型,总参数量276B,激活参数12B。它的大小仅为更大版本Inkling的四分之一,但性能与之相当。该模型原生支持音频和图像推理,具备可变的思考深度,并拥有100万token的上下文窗口。

Inkling

Product Hunt

Inkling 是一个开放权重的 975B 多模态 AI 模型,专为微调而设计。

thinkingmachines/Inkling

Hugging Face Models Trending

Inkling is a large open-weights multimodal model (975B total, 41B active parameters) using a sparse MoE architecture, accepting text, image, and audio inputs and generating text outputs, intended for agentic systems, coding assistants, and chatbots.