研究智能体最实用的记忆或许是其拒绝的实验

Reddit r/AI_Agents 论文

摘要

AQuA v2预印本介绍了一种为研究智能体设计的记忆系统,该系统利用已接受和拒绝实验的持久证据来指导未来的提案,强调了证据生命周期管理的重要性。

大多数智能体记忆讨论都从回忆开始:系统能检索多少先前文本?AQuA v2预印本描述了一种不同的记忆对象。在每个研究循环中,经过验证的证据会更新特定部分的持久状态,该状态指导后续提案。提案语言模型和评估器保持不变;连续性来自于循环已建立的内容,包括对其接受和拒绝想法的证据。第一部分使该工作流程具体化。一个AI管理者协调六个顺序专家:Data Steward、Visual Analyst、Idea Miner、Factor Evaluator、Backtest Engineer和Research Librarian。反馈在回测内、运行内和跨运行中运作。角色链以Research Librarian结束。更重要的是,持久状态不仅仅是更长的对话:后续提案可以继承哪些机制通过了评估,哪些机制失败了,因此下次搜索不必将每个旧想法都视为同样可信。这表明对研究智能体有一个更严格的记忆测试:后续提案能否恢复其动机的证据和拒绝原因?如果它只能检索旧的措辞,系统就有历史,但不一定有研究状态。持久证据并非永远自动可信。过时的结果可能仍然有说服力,两个评估可能冲突,固定的评估器可能验证了后来需要纠正的内容。开放的设计问题是证据的生命周期,而不仅仅是其存储格式。来源是Guo等人的AQuA v2,arXiv:2608.12841;此处总结了完整机制,因此帖子不依赖于链接。您会在证据账本中要求什么:每个结果的出处、明确的拒绝原因、过期规则,还是取代矛盾发现的方法?
查看原文

相似文章

当智能体需要改变主意时,仅追加记忆恰恰是错误的

Reddit r/AI_Agents

一篇名为 TEPA 的新预印本将记忆有效性视为一等状态,当新证据与旧先例冲突时,撤销过时的先例,同时保留审计轨迹。在完全反转实验中,它优于仅追加和后写胜出,但结果尚未被独立复现。

智能体记忆不仅仅是基于用户事实的RAG

Reddit r/AI_Agents

文章认为,简单的基于RAG的智能体记忆系统在生产中会失败,原因包括过时的偏好、遗漏的关键词和提示注入等问题,并主张采用分层记忆架构,具备主动选择、确定性回退、治理和测试等功能。