标签
本文提供了因果证据,表明在群组合任务上训练的矩阵记忆中的梯度下降精确招募了任务代数所需的秩,这与有限群的最小忠实表示维度相关。
本文测试大语言模型是否能通过逐步计算MD5哈希,在长序列的依赖工具调用中保持精确状态。研究表明,通过适当的上下文和投票机制,LLM可以在这种精确的多步骤过程中实现高成功率。
Google推出SKILL.state方法,该方法通过跟踪结构化状态而非对话历史,在长时间会话中减少AI智能体token使用量达94%,实现高精度和高效资源利用。
论文介绍了'recirculation',这是一种针对基础模型的推理时架构增强技术,通过改进状态跟踪,显著降低了困惑度并提高了准确性,在生成过程中无额外延迟。
本文介绍了StateMemBench,一个用于评估LLM智能体记忆系统中状态追踪的基准测试,并提出了StateMem,一种提高长交互中当前状态准确性的方法。
这个帖子认为,标准Transformer存在一个拓扑缺陷:一旦状态表示到达顶层,它们就无法随时间更新信念,随着层数增加导致崩溃。
本文在复杂序列建模任务上比较了 xLSTM、Mamba-2 和 Gated DeltaNet,发现 xLSTM 因其增强的状态追踪和记忆动态而更优,并在合成长度泛化任务上得到验证。
介绍VSTAT,一个衡量多模态大语言模型在视频中追踪状态能力的新基准,揭示前沿模型在人类认为简单的任务上表现不佳。
本文证明,扩展的思维链推理在确定性状态追踪任务上会降低性能,其原因并非偏好偏差,而是源于仅解码器注意力的信息论限制。当推理视界超过阈值时,本文提出工具委派的方法。
文章讨论的是,AI代理在真实工作流程中的主要挑战并非理解任务,而是处理意外变化的恢复、状态跟踪以及知道何时需要人工输入。
作者观察到手机用AI代理最难的部分是追踪状态变化,因为移动界面相比桌面有更多动态和中断性的UI变化,并询问他人的经验。
本文认为,循环模型中鲁棒的状态跟踪取决于误差控制动力学,而不仅仅取决于表达能力,证明了仿射循环网络会遭受累积误差的影响,从而限制了其有效视野。