潜在递归LLM系统的原理性思考
摘要
本文提出REST,一种针对潜在递归LLM系统的新型训练目标,通过将因果性和最小化等特性融入可微损失中,在基准测试中将准确率提高了多达7.5个百分点。
查看缓存全文
缓存时间: 2026/09/30 04:19
论文页面 - 潜在递归LLM系统的原理性思考
来源:https://huggingface.co/papers/2609.36159
摘要
大型语言模型可以在连续空间中进行推理,而无需解码成文本——通过递归自身隐藏状态或在智能体间传递这些状态来实现。然而训练过程仅监督最终解码答案的交叉熵(CE),并不约束思考过程本身。理论与实证分析确立并证实了仅使用CE训练的四种缺陷,这些缺陷会导致正确答案概率降低,例如不同问题间思考过程坍缩、保留无关信息等。我们提出REST(表征监督思考)训练目标,它将有效思考表征的四种属性(因果性、最小性、可分性、稳定性)转化为可微损失函数,并加入到CE损失中。我们将REST应用于潜在的单智能体和多智能体系统,无需架构修改或在推理时增加参数。在跨越数学、科学、医学和代码生成的7个基准测试中,在相同训练数据、计算量和潜在空间预算下,REST在不同智能体设置和模型规模上,比仅使用CE训练准确率最高提升7.5个百分点,并且最终答案的收敛速度提高30%。此外,REST生成的思考编码了更多获得正确答案所需的信息,解码这些思考能更好地恢复智能体预期输出,使潜在通信更易解释。项目网站:https://fard-lab.github.io/REST
查看arXiv页面 (https://arxiv.org/abs/2609.36159) 查看PDF (https://arxiv.org/pdf/2609.36159) 项目页面 (https://fard-lab.github.io/REST/) GitHub0 (https://github.com/FARD-Lab/REST) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36159)
在您的智能体中获取此论文:
hf papers read 2609\.36155
没有最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.36159,即可从本页建立链接。
引用本文的数据集0
暂无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.36159,即可从本页建立链接。
引用本文的Space0
暂无Space链接此论文
在Space的README.md中引用arxiv.org/abs/2609.36159,即可从本页建立链接。
包含本文的合集0
暂无合集包含本文
将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页建立链接。
相似文章
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
形式化潜在思维:大语言模型中思维表征的四条公理
提出了一种用于大语言模型中潜在思维表征的公理化评估框架,揭示当前表征在23个推理任务中无法满足四个基本功能公理(Causality, Minimality, Separability, Stability),表明表征质量存在结构性差距。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
通过低秩防御和电路引导代理的高效LLM对抗训练
本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。
后训练中的忽视免费午餐:LLM代理的进度优势
本文介绍了“进度优势”,一种从强化学习后训练中推导出的隐式优势函数,能够为LLM代理提供有效的步骤级评分,而无需进行专门的奖励模型训练。它在多个基准测试和模型系列上优于基于置信度的基线和训练好的奖励模型。