Intern-S2-Mobius:解耦知识与推理的基础模型
摘要
该论文介绍了Mobius-v0,一种将知识存储与推理解耦以提升效率的架构,表明一个7B模型在62.6%的训练数据下能达到可比性能,而Intern-S2-Mobius实现了4倍推理加速。
查看缓存全文
缓存时间: 2026/08/17 03:45
论文页面 - Intern-S2-Mobius:解耦知识与推理的基础模型
来源:https://huggingface.co/papers/2608.14290 发布于 8 月 14 日
#1 每日精选论文 (https://huggingface.co/papers/date/2026-08-17) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Mobius-v0 将全局记忆存储与迭代式推理模块分离,以提高知识压缩和推理效率,从而以更少的训练数据和更快的推理速度,获得可比的性能。
我们引入了 Mobius-v0 (https://huggingface.co/papers?q=Mobius-v0),这是一种架构,包含一个全局共享的 Memory (FFN) (https://huggingface.co/papers?q=Memory%20(FFN)) 来存储知识向量,以及多个 Reasoners (Self-Attn) (https://huggingface.co/papers?q=Reasoners%20(Self-Attn)) 来迭代实现组合推理 (compositional reasoning) (https://huggingface.co/papers?q=compositional%20reasoning)。该架构使用隐藏状态作为缓存和载体,推理器反复查询记忆以获取所需的知识向量,同时知识被传回推理算子。通过这种知识-推理分离 (knowledge-reasoning-separation) (https://huggingface.co/papers?q=knowledge-reasoning-separation) 架构,Mobius 实现了更好的知识压缩和推理效率。基于 Mobius-v0 (https://huggingface.co/papers?q=Mobius-v0) 架构:1) 我们从头训练的 7B 模型,使用基线 62.6% 的训练数据,就达到了与 7B Transformer 基线模型相当的下游任务分数。2) 我们的 Intern-S2-Mobius (https://huggingface.co/papers?q=Intern-S2-Mobius),从 Qwen3.5-35B 持续预训练而来,在获得相似下游任务分数的同时,实现了近 4 倍的端到端推理加速。
查看 arXiv 页面 (https://arxiv.org/abs/2608.14290)查看 PDF (https://arxiv.org/pdf/2608.14290)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14290)
在您的代理中获取此论文:
hf papers read 2608\.14290
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.14290 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.14290 以从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.14290 以从此页面链接。
包含此论文的收藏夹0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
Intern S2 Mobius
Intern-S2 Mobius 是一个基于 Qwen3.5-35B 的模型,其架构差异据称可提高吞吐量并减少 token 消耗。
小型LLM架构:Raven Agent(本地RTX5080)+ Trinity Cortex(7B/13B/MoE在线)
描述了一个双层小型LLM架构:一个本地常驻代理(Raven)运行在RTX5080上,以及一个在线推理栈(Trinity Cortex),包含三个小模型和一个知识图谱,论证了小模型在基于图的推理中优于大型前沿模型。
Intern-S2-397B(多模态、推理、编程与科学智能体能力)
Intern-S2-397B 是一款大型多模态AI模型,具备推理、编程和科学智能体任务的能力,现已在 Hugging Face 上可用,并得到 vLLM 的首日支持。
基础模型中的集体智能
本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。
从大型推理模型到紧凑型学生模型的知识蒸馏:以John O Bryan数学竞赛为例
本文研究了从DeepSeek-R1推理模型到紧凑型Qwen2.5-7B学生模型的知识蒸馏,使用了基于John O'Bryan数学竞赛问题构建的思维链(CoT)语料库。微调后的学生模型在竞赛数据集上取得了4.76个百分点的提升,并泛化到MATH-500,同时还分析了回答长度对推理质量的影响。