AQuA的“自我提升”更新研究状态,而非代理LM。本地移植应冻结什么?

Reddit r/LocalLLaMA 论文

摘要

本文分析了AQuA关于AI代理递归自我提升的预印本,阐明代理LM保持固定而研究状态更新,并倡导进行详细的消融研究和工件共享,以实现可信的本地模型移植。

AQuA的预印本使用“递归自我提升”来描述一个有界的研究循环。它并未说明研究代理LM会重写自身权重。该论文区分了三个对象:驱动研究代理的语言模型和评估器在每个部分内保持固定。每个部分都有自己的持久化研究状态。经过验证的实验会更新该状态并指导后续提案;第一部分和第二部分不共享它。在第二部分中,每个配置差异都会产生一个单独训练的混合任务模型变体。该训练是实验的一部分,而非对研究代理LM的更新。如果有人将工具集移植到本地LM上,这一点很重要。在单次AQuA运行中,后续提案可能会因为保留的状态发生变化而改变,即使代理LM没有变化。在两次移植之间,分数差异可能来自代理模型、状态历史、提示和工具、评估器反馈或候选训练路径,除非这些变量被分离。一个有用的发布应包括:确切的代理模型和量化版本,以及上下文和采样设置;系统提示、工具模型和初始研究状态;每一次状态更新和评估器返回;评估器版本、配置差异和候选训练设置;种子和每次运行的跟踪。至少,比较需要三类消融研究:在相同的工具集和初始状态下仅交换代理LM;保持LM固定同时重置或重放研究状态;以及保持LM和状态固定同时更改工具集或评估器合同。对于第二部分,候选任务模型训练需要有自己的日志,否则训练候选的变化会被纳入对代理模型能力的声称中。该预印本提供了架构级别的分离,但未发布可运行的实现或足够的细节以实现端到端重现。本地模型移植将是一个新实验,而非报道的AQuA结果。如果首先只发布一个工件,哪一个会让归因最可信:状态转换日志、评估器合同,还是带有重复种子的完整模型-工具集矩阵?
查看原文

相似文章

AQuA:递归自我改进的量化交易研究智能体

arXiv cs.CL

AQuA 是一个研究系统,包含两个独立的语言模型驱动智能体,它们在量化交易研究中递归地自我改进,在加密货币和美国股票上取得了较强的信息系数,同时使用密封沙箱防止数据泄漏。