AQuA的“自我提升”更新研究状态,而非代理LM。本地移植应冻结什么?
摘要
本文分析了AQuA关于AI代理递归自我提升的预印本,阐明代理LM保持固定而研究状态更新,并倡导进行详细的消融研究和工件共享,以实现可信的本地模型移植。
AQuA的预印本使用“递归自我提升”来描述一个有界的研究循环。它并未说明研究代理LM会重写自身权重。该论文区分了三个对象:驱动研究代理的语言模型和评估器在每个部分内保持固定。每个部分都有自己的持久化研究状态。经过验证的实验会更新该状态并指导后续提案;第一部分和第二部分不共享它。在第二部分中,每个配置差异都会产生一个单独训练的混合任务模型变体。该训练是实验的一部分,而非对研究代理LM的更新。如果有人将工具集移植到本地LM上,这一点很重要。在单次AQuA运行中,后续提案可能会因为保留的状态发生变化而改变,即使代理LM没有变化。在两次移植之间,分数差异可能来自代理模型、状态历史、提示和工具、评估器反馈或候选训练路径,除非这些变量被分离。一个有用的发布应包括:确切的代理模型和量化版本,以及上下文和采样设置;系统提示、工具模型和初始研究状态;每一次状态更新和评估器返回;评估器版本、配置差异和候选训练设置;种子和每次运行的跟踪。至少,比较需要三类消融研究:在相同的工具集和初始状态下仅交换代理LM;保持LM固定同时重置或重放研究状态;以及保持LM和状态固定同时更改工具集或评估器合同。对于第二部分,候选任务模型训练需要有自己的日志,否则训练候选的变化会被纳入对代理模型能力的声称中。该预印本提供了架构级别的分离,但未发布可运行的实现或足够的细节以实现端到端重现。本地模型移植将是一个新实验,而非报道的AQuA结果。如果首先只发布一个工件,哪一个会让归因最可信:状态转换日志、评估器合同,还是带有重复种子的完整模型-工具集矩阵?
相似文章
AQuA:递归自我改进的量化交易研究智能体
AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。
@tli104: 新论文:"Self-Compacting Language Model Agents" 语言模型代理会构建冗长的推理和工具调用轨迹。随着轨…
新论文提出自压缩语言模型代理,该类代理可自行决定何时清理其推理和工具调用轨迹,以避免积累错误和过时信息。
@HuggingPapers: 现代智能体系统中的自我改进——一项涵盖239篇论文的调研,关于AI智能体如何通过更新模型…
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。
@rohanpaul_ai: 更好的自我改进智能体需要更好的求解器,而非更大的更新编写模型。这挑战了常见的习惯……
本文厘清了自我改进的LLM智能体中进化器与智能体的角色,表明一个小型进化器可以编写足够好的更新,而中端智能体最能从中受益。论文建议将最强的模型用作任务执行器,而非更新编写器。
@dair_ai: 关于自我改进智能体的优秀论文:
本周一篇重要的AI论文探讨了自我改进智能体是否真正发现新知识,还是仅仅在重新混合现有信息。