潜在递归LLM系统的原理性思考

Hugging Face Daily Papers 论文

摘要

本文提出REST,一种针对潜在递归LLM系统的新型训练目标,通过将因果性和最小化等特性融入可微损失中,在基准测试中将准确率提高了多达7.5个百分点。

大型语言模型可以通过递归自身的隐藏状态或在不同代理之间传递这些状态,在连续空间中进行推理,而不是使用解码后的文本,而训练仅监督最终解码答案的交叉熵(CE),并不约束思考过程。理论和实证分析确立并证实了仅使用CE训练的四个缺陷,这些缺陷导致正确答案的概率降低,例如在不同问题间压缩思考和保留无关信息。我们引入REST(表征监督思考),一种训练目标,将有效思考表征的四个特性(因果性、最小化、可分性和稳定性)转化为添加到CE的可微损失。我们在潜在单代理和多代理系统中实例化它,无需架构更改或在推理时添加额外参数。在涵盖数学、科学、医学和代码生成的7个基准测试中,使用相同的训练数据、计算和潜在预算,REST在不同代理设置和模型大小上将准确率比仅使用CE训练提高了多达7.5个百分点,并将最终答案的收敛速度提高了30%。此外,REST思考编码了更多实现正确答案所需的内容,解码它们能更好地恢复代理的预期输出,使潜在通信更易于解释。项目网站:https://fard-lab.github.io/REST
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:19

论文页面 - 潜在递归LLM系统的原理性思考

来源:https://huggingface.co/papers/2609.36159

摘要

大型语言模型可以在连续空间中进行推理,而无需解码成文本——通过递归自身隐藏状态或在智能体间传递这些状态来实现。然而训练过程仅监督最终解码答案的交叉熵(CE),并不约束思考过程本身。理论与实证分析确立并证实了仅使用CE训练的四种缺陷,这些缺陷会导致正确答案概率降低,例如不同问题间思考过程坍缩、保留无关信息等。我们提出REST(表征监督思考)训练目标,它将有效思考表征的四种属性(因果性、最小性、可分性、稳定性)转化为可微损失函数,并加入到CE损失中。我们将REST应用于潜在的单智能体和多智能体系统,无需架构修改或在推理时增加参数。在跨越数学、科学、医学和代码生成的7个基准测试中,在相同训练数据、计算量和潜在空间预算下,REST在不同智能体设置和模型规模上,比仅使用CE训练准确率最高提升7.5个百分点,并且最终答案的收敛速度提高30%。此外,REST生成的思考编码了更多获得正确答案所需的信息,解码这些思考能更好地恢复智能体预期输出,使潜在通信更易解释。项目网站:https://fard-lab.github.io/REST

查看arXiv页面 (https://arxiv.org/abs/2609.36159) 查看PDF (https://arxiv.org/pdf/2609.36159) 项目页面 (https://fard-lab.github.io/REST/) GitHub0 (https://github.com/FARD-Lab/REST) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36159)

在您的智能体中获取此论文:

hf papers read 2609\.36155

没有最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.36159,即可从本页建立链接。

引用本文的数据集0

暂无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.36159,即可从本页建立链接。

引用本文的Space0

暂无Space链接此论文

在Space的README.md中引用arxiv.org/abs/2609.36159,即可从本页建立链接。

包含本文的合集0

暂无合集包含本文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页建立链接。

相似文章

形式化潜在思维:大语言模型中思维表征的四条公理

Hugging Face Daily Papers

提出了一种用于大语言模型中潜在思维表征的公理化评估框架,揭示当前表征在23个推理任务中无法满足四个基本功能公理(Causality, Minimality, Separability, Stability),表明表征质量存在结构性差距。

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

后训练中的忽视免费午餐:LLM代理的进度优势

Hugging Face Daily Papers

本文介绍了“进度优势”,一种从强化学习后训练中推导出的隐式优势函数,能够为LLM代理提供有效的步骤级评分,而无需进行专门的奖励模型训练。它在多个基准测试和模型系列上优于基于置信度的基线和训练好的奖励模型。