Intern-S2-Mobius:解耦知识与推理的基础模型

Hugging Face Daily Papers 论文

摘要

该论文介绍了Mobius-v0,一种将知识存储与推理解耦以提升效率的架构,表明一个7B模型在62.6%的训练数据下能达到可比性能,而Intern-S2-Mobius实现了4倍推理加速。

我们介绍Mobius-v0,一种架构,它包含全局共享的记忆(FFN)用于存储知识向量,以及多个推理器(Self-Attn)通过迭代实现组合推理。使用隐藏状态作为缓存和载体,推理器反复查询记忆以获取所需的知识向量,同时知识被传回推理操作符。通过这种知识-推理分离架构,Mobius实现了更好的知识压缩和推理效率。基于Mobius-v0架构:1)我们从零训练的7B模型,在使用基线62.6%的训练数据下,达到了与7B Transformer基线相似的下游分数。2)我们的Intern-S2-Mobius,从Qwen3.5-35B持续预训练而来,达到了相似的下游分数,同时实现了近4倍的端到端推理加速。
查看原文
查看缓存全文

缓存时间: 2026/08/17 03:45

论文页面 - Intern-S2-Mobius:解耦知识与推理的基础模型

来源:https://huggingface.co/papers/2608.14290 发布于 8 月 14 日

#1 每日精选论文 (https://huggingface.co/papers/date/2026-08-17) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Mobius-v0 将全局记忆存储与迭代式推理模块分离,以提高知识压缩和推理效率,从而以更少的训练数据和更快的推理速度,获得可比的性能。

我们引入了 Mobius-v0 (https://huggingface.co/papers?q=Mobius-v0),这是一种架构,包含一个全局共享的 Memory (FFN) (https://huggingface.co/papers?q=Memory%20(FFN)) 来存储知识向量,以及多个 Reasoners (Self-Attn) (https://huggingface.co/papers?q=Reasoners%20(Self-Attn)) 来迭代实现组合推理 (compositional reasoning) (https://huggingface.co/papers?q=compositional%20reasoning)。该架构使用隐藏状态作为缓存和载体,推理器反复查询记忆以获取所需的知识向量,同时知识被传回推理算子。通过这种知识-推理分离 (knowledge-reasoning-separation) (https://huggingface.co/papers?q=knowledge-reasoning-separation) 架构,Mobius 实现了更好的知识压缩和推理效率。基于 Mobius-v0 (https://huggingface.co/papers?q=Mobius-v0) 架构:1) 我们从头训练的 7B 模型,使用基线 62.6% 的训练数据,就达到了与 7B Transformer 基线模型相当的下游任务分数。2) 我们的 Intern-S2-Mobius (https://huggingface.co/papers?q=Intern-S2-Mobius),从 Qwen3.5-35B 持续预训练而来,在获得相似下游任务分数的同时,实现了近 4 倍的端到端推理加速。

查看 arXiv 页面 (https://arxiv.org/abs/2608.14290)查看 PDF (https://arxiv.org/pdf/2608.14290)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14290)

在您的代理中获取此论文:

hf papers read 2608\.14290

还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.14290 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.14290 以从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.14290 以从此页面链接。

包含此论文的收藏夹0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Intern S2 Mobius

Reddit r/LocalLLaMA

Intern-S2 Mobius 是一个基于 Qwen3.5-35B 的模型,其架构差异据称可提高吞吐量并减少 token 消耗。

基础模型中的集体智能

arXiv cs.CL

本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。